گوگل با رونمایی از بهروزرسانی جدید مدل Gemini 3.8 Live، گامی بلند در جهت شخصیسازی و انسانیسازی تعامل با هوش مصنوعی برداشته است. این قابلیت جدید که تحت عنوان Live Avatar شناخته میشود، به کاربران اجازه میدهد تا در حین مکالمه صوتی، شاهد یک آواتار متحرک باشند که با استفاده از تکنیکهای همگامسازی لب (Lip-sync) و بازنمایی حالات چهره، واکنشی پویا و بلادرنگ به کاربر نشان میدهد.
تجربه تعامل دیداری با Gemini
قابلیت Live Avatar در نسخه 3.8 جیمنای، فراتر از یک رابط کاربری ساده متنی یا صوتی عمل میکند. این مدل با تحلیل بلادرنگ ورودی صوتی، نهتنها پاسخهای متنی تولید میکند، بلکه حرکات صورت و میمیکهای متناسب با لحن و احساسات کلام را برای آواتار مجازی شبیهسازی میکند. این پیشرفت باعث میشود که فاصله میان تعامل با یک ماشین و گفتوگو با یک دستیار هوشمند تا حد زیادی کاهش یابد.
ویژگیهای فنی و نحوه عملکرد
- مدل هسته: Gemini 3.8
- قابلیت کلیدی: رندرینگ بلادرنگ حالات چهره (Real-time Facial Expressions)
- فناوری همگامسازی: Lip-sync پویا بر اساس پردازش سیگنالهای صوتی
- پلتفرم: محیط تعاملی Live اختصاصی گوگل
این فناوری با کاهش تاخیر (Latency) در پردازشهای چندوجهی (Multimodal) همراه بوده است تا حرکت آواتار با متن ادا شده کمترین اختلاف زمانی را داشته باشد. این امر نیازمند پردازشهای سنگین در سمت سرورهای Google است تا تجربهای روان و بدون وقفه برای کاربر فراهم شود.
محدودیتها و چشمانداز آینده
در حال حاضر، این قابلیت به صورت محدود عرضه شده است و تنها بخشی از کاربران پلتفرم Google Gemini به آن دسترسی دارند. تمرکز فعلی گوگل بر بهینهسازی مدل برای کاهش مصرف منابع پردازشی و افزایش دقت در تشخیص عواطف است تا آواتارها در آینده نزدیک بتوانند درک عمیقتری از محتوای گفتوگو داشته باشند.