شرکت اپل پس از ماهها کشمکش حقوقی و اعتراض خریداران آیفون ۱۵ پرو و آیفون ۱۶، سرانجام با پرداخت مبلغ چشمگیر ۲۵۰ میلیون دلار برای مصالحه در پرونده شکایت گروهی (Class Action) پیرامون عمل نکردن به وعدههای تبلیغاتی دستیار هوش مصنوعی Siri AI موافقت کرد. این پرونده ابعاد پنهانی از چالشهای فنی طاقتفرسای توسعه مدلهای زبانی صوتی Real-Time را آشکار ساخته است.
شکاف عمیق میان شعارهای بازاریابی و واقعیت مهندسی هوش مصنوعی
در جریان کنفرانسهای WWDC، اپل وعده داده بود که سیری با تکیه بر معماری Apple Intelligence به درک عمیق از بافتار شخصی کاربر (Personal Context)، ارجاع به محتوای روی صفحه (Screen Awareness) و قابلیت مکالمه صوتی طبیعی بدون تأخیر مجهز خواهد شد. با این حال، با عرضه پرچمداران این شرکت، مشخص شد که بخش اعظم این قابلیتها با تأخیرهای پیاپی و کاستیهای چشمگیر روبرو شدهاند.
بر اساس شروط توافق دادگاه فدرال، دارندگان واجد شرایط آیفونهای نسل جدید در ایالات متحده میتوانند با ثبتنام در وبسایت رسمی مصالحه حقوقی، مبالغی بین ۲۵ تا ۹۵ دلار به ازای هر دستگاه دریافت نمایند.
«پرونده سیری نشان داد که تبدیل مدلهای زبانی متنی به دستیارهای صوتی همزمان (End-to-End Speech-to-Speech) در مقیاس صدها میلیون دستگاه تلفن همراه، فراتر از یک چالش نرمافزاری بوده و با محدودیتهای فیزیکی حافظه و پهنای باند تراشهها گره خورده است.»
— تحلیلگر ارشد حوزه هوش مصنوعی در پلتفرم The Verge
چالشهای معماری در اجرای مدلهای صوتی محلی (On-Device Speech AI)
چرا اپل علیرغم برخورداری از پیشرفتهترین چیپهای A18 Pro نتوانست به موقع به وعدههای سیری صوتی جامع جامه عمل بپوشاند؟ مهندسان هوش مصنوعی به سه مانع بنیادین اشاره میکنند:
- تأخیر بحرانی پردازش صوت (Latency Bottleneck): در مکالمه انسانی، تأخیر بیش از ۲۵۰ میلیثانیه غیرطبیعی و ناخوشایند جلوه میکند. خط لولههای قدیمی تبدیل صوت به متن (STT)، ارسال متن به مدل زبانی (LLM) و تبدیل مجدد به گفتار (TTS) ذاتاً تأخیری بین ۶۰۰ تا ۱۲۰۰ میلیثانیه تولید میکنند.
- اشغال پهنای باند و ظرفیت حافظه رم گوشی: نگهداری وزنهای یک مدل صوتی باکیفیت به حداقل ۶ تا ۸ گیگابایت فضای رم اختصاصی نیاز دارد که اجرای همزمان بازیها و اپلیکیشنها در کنار آن را با افت شدید فریم مواجه میسازد.
- حریم خصوصی و چالش ابر اختصاصی (Private Cloud Compute): اپل متعهد شده بود دادههای صوتی هرگز در سرورها ذخیره یا تحلیل نشوند. تضمین محاسبات رمزنگاریشده در حجم ترافیک میلیونی کاربران چالشهای فنی زیرساختی عظیمی به همراه داشت.
تفاوت رویکرد خط لوله سهمرحلهای با مدلهای Speech-to-Speech نوین
# مقایسه مفهومی خط لوله سنتی سیری با مدلهای مدرن یکپارچه صوتی
# رویکرد قدیمی (چندمرحلهای با تاخیر بالا):
audio_input = record_mic()
text_prompt = speech_to_text_engine(audio_input) # ~300ms
llm_response = language_model.generate(text_prompt) # ~500ms
audio_output = text_to_speech_engine(llm_response) # ~250ms
# مجموع تاخیر: بیش از ۱ ثانیه!
# رویکرد نوین Full-Duplex (مدلهای گفتار به گفتار مستقیم):
# مدل وزنهای آکوستیک را مستقیما به سیگنال خروجی مپ میکند
direct_voice_stream = multimodal_audio_transformer(audio_input) # < 180ms
آینده دستیارهای صوتی و گامهای بعدی اپل
مصالحه ۲۵۰ میلیون دلاری اپل اگرچه بار مالی و تبلیغاتی سنگینی بر دوش این کمپانی گذاشت، اما تمرکز تیمهای تحقیقاتی کوپرتینو را به سمت بازطراحی کامل سیری بر پایهی مدلهای مولتیمدال یکپارچه هدایت کرده است. انتظار میرود بهروزرسانیهای اساسی این دستیار با ادغام پیشرفتهتر سرورهای محاسباتی Private Cloud Compute در ماههای آتی برای کاربران عرضه شود.