هوش مصنوعی و یادگیری ماشین

تحولی در تعامل انسانی با هوش مصنوعی: معرفی Gemini 3.8 Live و قابلیت Live Avatar

گوگل با رونمایی از به‌روزرسانی جدید مدل Gemini 3.8 Live، گامی بلند در جهت شخصی‌سازی و انسانی‌سازی تعامل با هوش مصنوعی برداشته است. این قابلیت جدید که تحت عنوان Live Avatar شناخته می‌شود، به کاربران اجازه می‌دهد تا در حین مکالمه صوتی، شاهد یک آواتار متحرک باشند که با استفاده از تکنیک‌های همگام‌سازی لب (Lip-sync) و بازنمایی حالات چهره، واکنشی پویا و بلادرنگ به کاربر نشان می‌دهد.

تجربه تعامل دیداری با Gemini

قابلیت Live Avatar در نسخه 3.8 جیمنای، فراتر از یک رابط کاربری ساده متنی یا صوتی عمل می‌کند. این مدل با تحلیل بلادرنگ ورودی صوتی، نه‌تنها پاسخ‌های متنی تولید می‌کند، بلکه حرکات صورت و میمیک‌های متناسب با لحن و احساسات کلام را برای آواتار مجازی شبیه‌سازی می‌کند. این پیشرفت باعث می‌شود که فاصله میان تعامل با یک ماشین و گفت‌وگو با یک دستیار هوشمند تا حد زیادی کاهش یابد.

ویژگی‌های فنی و نحوه عملکرد

  • مدل هسته: Gemini 3.8
  • قابلیت کلیدی: رندرینگ بلادرنگ حالات چهره (Real-time Facial Expressions)
  • فناوری همگام‌سازی: Lip-sync پویا بر اساس پردازش سیگنال‌های صوتی
  • پلتفرم: محیط تعاملی Live اختصاصی گوگل

این فناوری با کاهش تاخیر (Latency) در پردازش‌های چندوجهی (Multimodal) همراه بوده است تا حرکت آواتار با متن ادا شده کمترین اختلاف زمانی را داشته باشد. این امر نیازمند پردازش‌های سنگین در سمت سرورهای Google است تا تجربه‌ای روان و بدون وقفه برای کاربر فراهم شود.

محدودیت‌ها و چشم‌انداز آینده

در حال حاضر، این قابلیت به صورت محدود عرضه شده است و تنها بخشی از کاربران پلتفرم Google Gemini به آن دسترسی دارند. تمرکز فعلی گوگل بر بهینه‌سازی مدل برای کاهش مصرف منابع پردازشی و افزایش دقت در تشخیص عواطف است تا آواتارها در آینده نزدیک بتوانند درک عمیق‌تری از محتوای گفت‌وگو داشته باشند.

📌 منبع و مطالعه بیشتر: The Verge: Gemini 3.8 Live Avatar Announcement
حامد

حامد

مسئول مجله فناوری آسمان نقره‌ای