هوش مصنوعی و یادگیری ماشین

معرفی قابلیت Guided Vision در جمینای؛ تحولی در دسترس‌پذیری بصری با هوش مصنوعی مولد

گوگل با معرفی قابلیت نوآورانه «Guided Vision» در پلتفرم Gemini Live، گامی بلند در جهت فراگیرسازی فناوری برای افراد دارای آسیب‌های بینایی برداشته است. این ابزار با بهره‌گیری از مدل‌های هوش مصنوعی چندوجهی (Multimodal AI)، به کاربران اجازه می‌دهد تا با استفاده از دوربین گوشی هوشمند خود، محیط پیرامون را به صورت آنی و صوتی توصیف کنند.

معماری و نحوه عملکرد Guided Vision

قابلیت Guided Vision بر پایه تعامل لحظه‌ای با مدل‌های زبانی بزرگ (LLM) طراحی شده است. زمانی که کاربر در محیط Gemini Live دوربین خود را فعال می‌کند، داده‌های تصویری به صورت جریانی (Stream) برای پردازش به سرورهای گوگل ارسال می‌شوند. هوش مصنوعی بلافاصله اشیاء، متون ریز و جزئیات محیطی را شناسایی کرده و خروجی را به صورت توصیفات صوتی دقیق به گوش کاربر می‌رساند.

این سیستم تنها به شناسایی اشیاء محدود نمی‌شود؛ بلکه می‌تواند متون کوچک (مانند برچسب‌های دارو یا قراردادها) را بخواند، موقعیت مکانی اشیاء خاص در اتاق را توصیف کند و تفاوت‌های ظریف در اجسام مختلف را شرح دهد. این سطح از درک محیطی، نشان‌دهنده پیشرفت قابل توجه در تکنولوژی‌های بینایی ماشین (Computer Vision) است که اکنون در مقیاس مصرف‌کننده در دسترس قرار گرفته است.

مقایسه با راهکارهای موجود در بازار

در بازار فناوری، رقابت بر سر دسترس‌پذیری (Accessibility) شدت گرفته است. اپل پیش‌تر قابلیت «VoiceOver Live Recognition» را برای iPhone و هدست Vision Pro معرفی کرده بود که از رویکردهای مشابه برای کمک به کاربران کم‌بینا استفاده می‌کند. تفاوت کلیدی رویکرد گوگل در یکپارچگی عمیق این قابلیت با اکوسیستم Gemini Live است که اجازه می‌دهد تعاملات صوتی به صورت مکالمه‌محور (Conversational) ادامه یابد؛ به طوری که کاربر می‌تواند سوالات تکمیلی درباره شیء شناسایی شده بپرسد.

ابعاد کاربردی و حریم خصوصی در پاییز ۱۴۰۳

این فناوری در کنار پایداری پردازشی، چالش‌های مربوط به حریم خصوصی را نیز به همراه دارد. گوگل تأکید کرده است که پردازش تصاویر در این سرویس با رعایت پروتکل‌های امنیتی برای حفظ حریم خصوصی کاربران انجام می‌شود. کاربران اکنون می‌توانند در شرایطی که نیاز به مطالعه متون با فونت بسیار ریز دارند، بدون نیاز به ابزارهای جانبی و تنها با تکیه بر دوربین گوشی، به اطلاعات متنی دسترسی پیدا کنند.

مشخصات فنی و نیازمندی‌های سیستم:

  • پلتفرم: اپلیکیشن Gemini Live (اندروید)
  • فناوری اصلی: مدل‌های Multimodal Gemini
  • نوع پردازش: Real-time Audio Description (توصیف صوتی لحظه‌ای)
  • قابلیت‌های کلیدی: خواندن متون ریز، شناسایی اشیاء محیطی، توصیف جزئیات بصری
  • سازگاری: دستگاه‌های اندرویدی واجد شرایط با آخرین نسخه اپلیکیشن Gemini

نتیجه‌گیری

قابلیت Guided Vision نه یک ابزار ساده، بلکه یک دستیار هوشمند برای افزایش کیفیت زندگی افراد جامعه است. با گذشت زمان و بهینه‌سازی الگوریتم‌های درک تصویر، انتظار می‌رود دقت این سرویس در محیط‌های پیچیده‌تر نیز افزایش یابد. در حالی که رقابت بین گوگل و اپل در حوزه هوش مصنوعی دسترس‌پذیر ادامه دارد، کاربران نهایی بیشترین بهره را از این نوآوری‌ها می‌برند.

📌 منبع و مطالعه بیشتر: گزارش اختصاصی The Verge درباره قابلیت Guided Vision
حامد

حامد

مسئول مجله فناوری آسمان نقره‌ای