هوش مصنوعی و یادگیری ماشین

توافق ۲۵۰ میلیون دلاری اپل در پرونده حقوقی هوش مصنوعی سیری و چالش‌های پردازش داده‌های صوتی

شرکت اپل پس از ماه‌ها کشمکش حقوقی و اعتراض خریداران آیفون ۱۵ پرو و آیفون ۱۶، سرانجام با پرداخت مبلغ چشمگیر ۲۵۰ میلیون دلار برای مصالحه در پرونده شکایت گروهی (Class Action) پیرامون عمل نکردن به وعده‌های تبلیغاتی دستیار هوش مصنوعی Siri AI موافقت کرد. این پرونده ابعاد پنهانی از چالش‌های فنی طاقت‌فرسای توسعه مدل‌های زبانی صوتی Real-Time را آشکار ساخته است.

شکاف عمیق میان شعارهای بازاریابی و واقعیت مهندسی هوش مصنوعی

در جریان کنفرانس‌های WWDC، اپل وعده داده بود که سیری با تکیه بر معماری Apple Intelligence به درک عمیق از بافتار شخصی کاربر (Personal Context)، ارجاع به محتوای روی صفحه (Screen Awareness) و قابلیت مکالمه صوتی طبیعی بدون تأخیر مجهز خواهد شد. با این حال، با عرضه پرچمداران این شرکت، مشخص شد که بخش اعظم این قابلیت‌ها با تأخیرهای پیاپی و کاستی‌های چشمگیر روبرو شده‌اند.

بر اساس شروط توافق دادگاه فدرال، دارندگان واجد شرایط آیفون‌های نسل جدید در ایالات متحده می‌توانند با ثبت‌نام در وب‌سایت رسمی مصالحه حقوقی، مبالغی بین ۲۵ تا ۹۵ دلار به ازای هر دستگاه دریافت نمایند.

«پرونده سیری نشان داد که تبدیل مدل‌های زبانی متنی به دستیارهای صوتی هم‌زمان (End-to-End Speech-to-Speech) در مقیاس صدها میلیون دستگاه تلفن همراه، فراتر از یک چالش نرم‌افزاری بوده و با محدودیت‌های فیزیکی حافظه و پهنای باند تراشه‌ها گره خورده است.»
— تحلیل‌گر ارشد حوزه هوش مصنوعی در پلتفرم The Verge

چالش‌های معماری در اجرای مدل‌های صوتی محلی (On-Device Speech AI)

چرا اپل علیرغم برخورداری از پیشرفته‌ترین چیپ‌های A18 Pro نتوانست به موقع به وعده‌های سیری صوتی جامع جامه عمل بپوشاند؟ مهندسان هوش مصنوعی به سه مانع بنیادین اشاره می‌کنند:

  1. تأخیر بحرانی پردازش صوت (Latency Bottleneck): در مکالمه انسانی، تأخیر بیش از ۲۵۰ میلی‌ثانیه غیرطبیعی و ناخوشایند جلوه می‌کند. خط لوله‌های قدیمی تبدیل صوت به متن (STT)، ارسال متن به مدل زبانی (LLM) و تبدیل مجدد به گفتار (TTS) ذاتاً تأخیری بین ۶۰۰ تا ۱۲۰۰ میلی‌ثانیه تولید می‌کنند.
  2. اشغال پهنای باند و ظرفیت حافظه رم گوشی: نگهداری وزن‌های یک مدل صوتی باکیفیت به حداقل ۶ تا ۸ گیگابایت فضای رم اختصاصی نیاز دارد که اجرای همزمان بازی‌ها و اپلیکیشن‌ها در کنار آن را با افت شدید فریم مواجه می‌سازد.
  3. حریم خصوصی و چالش ابر اختصاصی (Private Cloud Compute): اپل متعهد شده بود داده‌های صوتی هرگز در سرورها ذخیره یا تحلیل نشوند. تضمین محاسبات رمزنگاری‌شده در حجم ترافیک میلیونی کاربران چالش‌های فنی زیرساختی عظیمی به همراه داشت.

تفاوت رویکرد خط لوله سه‌مرحله‌ای با مدل‌های Speech-to-Speech نوین

# مقایسه مفهومی خط لوله سنتی سیری با مدل‌های مدرن یکپارچه صوتی
# رویکرد قدیمی (چندمرحله‌ای با تاخیر بالا):
audio_input = record_mic()
text_prompt = speech_to_text_engine(audio_input)      # ~300ms
llm_response = language_model.generate(text_prompt)   # ~500ms
audio_output = text_to_speech_engine(llm_response)    # ~250ms
# مجموع تاخیر: بیش از ۱ ثانیه!

# رویکرد نوین Full-Duplex (مدل‌های گفتار به گفتار مستقیم):
# مدل وزن‌های آکوستیک را مستقیما به سیگنال خروجی مپ می‌کند
direct_voice_stream = multimodal_audio_transformer(audio_input) # < 180ms

آینده دستیارهای صوتی و گام‌های بعدی اپل

مصالحه ۲۵۰ میلیون دلاری اپل اگرچه بار مالی و تبلیغاتی سنگینی بر دوش این کمپانی گذاشت، اما تمرکز تیم‌های تحقیقاتی کوپرتینو را به سمت بازطراحی کامل سیری بر پایه‌ی مدل‌های مولتی‌مدال یکپارچه هدایت کرده است. انتظار می‌رود به‌روزرسانی‌های اساسی این دستیار با ادغام پیشرفته‌تر سرورهای محاسباتی Private Cloud Compute در ماه‌های آتی برای کاربران عرضه شود.

admin

نویسنده و پژوهشگر حوزه فناوری اطلاعات، هوش مصنوعی و برنامه‌نویسی در سیلور اسکای.