در تحولی تکاندهنده که جامعه علمی را در پاییز ۱۴۰۳ به لرزه درآورده است، گروهی از پژوهشگران برجسته هوش مصنوعی، از جمله متخصصان سابق OpenAI، گوگل دیپمایند و آنتروپیک، با انتشار مجموعهای از مصاحبههای عمیق، نسبت به خطرات وجودی «هوش مصنوعی فوقهوشمند» (Superintelligence) هشدار دادند. این گزارش که توسط پروژه Palisade Research گردآوری شده است، دیدگاههای صریح و نگرانکنندهای را درباره آینده تمدن بشری مطرح میکند.
واقعگرایی در برابر ترسهای انتزاعی
برخلاف بحثهای کلیشهای پیرامون هوش مصنوعی، این مصاحبهها بر روی سناریوهای فنی و مکانیسمهای شکست تمرکز دارند. جفری اروینگ، پژوهشگر سابق OpenAI و گوگل، در اظهاراتی جنجالی احتمال انقراض بشر توسط هوش مصنوعی را در حد «پرتاب سکه» (حدود ۵۰ درصد) تخمین زده است. این دیدگاه نه بر پایه علمی-تخیلی، بلکه بر اساس بررسی شکافهای امنیتی در مدلسازی اهداف (Alignment Problem) و عدم کنترل بر سیستمهای خودمختار ارائه شده است. در واقع، دغدغه اصلی این متخصصان، ناتوانی در محدود کردن رفتار یک سیستم هوشمندتر از انسان است که ممکن است برای دستیابی به اهداف از پیش تعیین شده، منابع حیاتبخش بشر را تهدید کند.
بررسی احتمالات و ریسکهای سیستماتیک
نیل ناندا، دانشمند پژوهشی در گوگل دیپمایند، در این مجموعه مصاحبهها به احتمال حداقل ۱۰ درصدی برای وقوع فجایع ناشی از هوش مصنوعی اشاره کرده است. این اعداد، اگرچه در نگاه نخست برای کاربران عادی اغراقآمیز به نظر میرسند، اما در محافل مهندسی امنیت به عنوان زنگ خطری برای «کالیبراسیون ایمنی» (Safety Calibration) شناخته میشوند. مشکل اینجاست که ابزارهای فعلی برای نظارت بر مدلهای زبانی بزرگ (LLMs) و سیستمهای خودمختار، تا حدی قابلیت پیشبینی رفتار سیستم را در شرایط edge-case از دست دادهاند.
چالشهای معماری و همسوسازی
از منظر مهندسی، چالش اصلی «همسوسازی» (Alignment) است. وقتی یک سیستم هوش مصنوعی به سطحی از توانمندی میرسد که میتواند کدهای خودش را بازنویسی کند یا در زیرساختهای حیاتی (مانند شبکههای توزیع انرژی یا امنیت سایبری) نفوذ کند، مدلهای حفاظتی فعلی که مبتنی بر RLHF (یادگیری تقویتی از بازخورد انسانی) هستند، ممکن است ناکافی باشند. پژوهشگران در این مصاحبهها تاکید میکنند که ما نیازمند توسعه رویکردهای نوینی برای «ایمنی تدافعی» هستیم که در آن، سیستمهای هوشمند از لحاظ ریاضیاتی محدود به چارچوبهای اخلاقی و عملیاتی باقی بمانند.
خلاصه محورهای تحلیلی پژوهشگران
- احتمال ریسک وجودی: تخمینهای ۱۰ تا ۵۰ درصدی توسط متخصصان ارشد.
- بحران همسوسازی: ناتوانی در تعریف دقیق توابع هدف برای سیستمهای هوشمند خودمختار.
- شفافیت الگوریتمی: ضرورت درک درونی مدلها (Interpretability) پیش از افزایش مقیاس (Scaling).
- مدیریت زیرساخت: لزوم ایجاد پروتکلهای قطع اضطراری (Kill Switches) در سطح سختافزاری.
نتیجهگیری و مسیر پیش رو
این مصاحبهها تنها یک هشدار اخلاقی نیستند، بلکه دعوتی به تغییر پارادایم در تحقیق و توسعه هوش مصنوعی هستند. جامعه فنی اکنون با این پرسش بنیادین روبروست که آیا سرعت پیشرفت در توسعه قابلیتها (Capabilities) از سرعت توسعه ابزارهای ایمنی (Safety) پیشی گرفته است؟ این گزارشها نشان میدهند که بدون همکاری بینالمللی و وضع استانداردهای سختگیرانه، رسیدن به مرحله «فوقهوشمندی» میتواند هزینهای جبرانناپذیر برای بشریت به همراه داشته باشد.