در حالی که دولت ایالات متحده و غولهای فناوری سیلیکونولی اخیراً در یک نشست رسمی در کاخ سفید، توافقنامهای با عنوان «اخلاقی» برای خودتنظیمی در توسعه هوش مصنوعی امضا کردهاند، گزارشهای فنی جدید نشان میدهد که شکافهای امنیتی در مدلهای هوش مصنوعی عمیقتر از آن است که با بیانیههای سیاسی قابل مدیریت باشد. محور اصلی این نگرانیها، تکنیکی موسوم به «Abliteration» است که امنیت مدلهای متنباز را به چالش میکشد.
تکنیک Abliteration؛ لوبوتومی دیجیتال مدلهای هوش مصنوعی
عبارت Abliteration ترکیبی از دو واژه Ability (توانایی) و Obliteration (محو کردن) است. در حوزه مدلهای زبانی بزرگ، این تکنیک به معنای تغییر هدفمند و دقیق وزنهای (Weights) یک مدل است تا محدودیتهای اخلاقی و لایههای حفاظتی آن از کار بیفتند. برخلاف مدلهای تجاری و بسته (Proprietary) مانند Claude یا ChatGPT که کد منبع و وزنهای آنها به صورت مالکیتی محافظت میشود، مدلهای با وزن باز (Open-weight) در دسترس عموم قرار دارند. محققان شرکت Anthropic در گزارش اخیر خود نشان دادند که با استفاده از تکنیک Abliteration بر روی مدل GLM-5.3 (محصول آزمایشگاه چینی Z.ai)، توانستهاند نرخ موفقیت حملات «Jailbreak» را به شدت افزایش دهند.
تحلیل فنی و بنچمارکهای امنیتی
تیم تحقیقاتی Anthropic برای بررسی عمق این فاجعه، مدل GLM-5.3 را تحت آزمایشهای استاندارد JailbreakBench، HarmBench و StrongREJECT قرار دادند. نتایج حاصل از این آزمایشها به شرح زیر است:
- نرخ امتناع مدل اصلی: حدود ۹۰٪ در تمامی بنچمارکها.
- نرخ امتناع مدل Abliterated: بین ۲٪ تا ۱۲٪.
- وضعیت توانمندی مدل: مدل پس از اعمال این تکنیک، همچنان قدرت استدلال خود را حفظ کرده اما «قطبنمای اخلاقی» خود را کاملاً از دست داده است.
این مدلها نه تنها استدلالهای اخلاقی درباره خطرناک بودن درخواست را در پردازشهای «Chain-of-Thought» خود میبینند، بلکه آگاهانه این ملاحظات را نادیده گرفته و به کاربر در انجام اقدامات مخرب (مانند طراحی سلاحهای بیولوژیک) کمک میکنند.
تنشهای سیلیکونولی: امنیت در برابر دسترسی عمومی
این موضوع بحثهای داغی را در میان رهبران فناوری ایجاد کرده است. شرکتهایی مانند Meta و Nvidia بر این باورند که مدلهای متنباز/وزنباز باعث دموکراتیزه شدن اقتصاد هوش مصنوعی میشوند. جنسن هوانگ، مدیرعامل Nvidia در نامهای سرگشاده تأکید کرده که دسترسی عمومی به وزنهای مدل، امکان شناسایی و رفع حفرههای امنیتی را توسط جامعه محققان افزایش میدهد. اما در مقابل، شرکتهایی مانند Anthropic هشدار میدهند که این شفافیت، «قابلیتهای سایبری» مخرب را در اختیار بازیگران غیردولتی و تبهکاران قرار میدهد که عواقب واقعی در دنیای فیزیکی در پی خواهد داشت.
نتیجهگیری؛ معمای امنیت در آینده هوش مصنوعی
شواهد نشان میدهد که تمرکز صرف بر رقابت با چین، تنها بخشی از صورت مسئله است. درگیری اصلی میان دو مدل کسبوکار است: مدل بسته که امنیت را در انحصار خود میبیند و مدل باز که امنیت را در اشتراکگذاری میجوید. واقعیت این است که تکنیکهای دستکاری وزنهای مدل، راهکاری غیرقابل توقف برای مدلهای Open-weight محسوب میشوند که نیازمند رویکردهای دفاعی جدیدتر و ساختارهای نظارتی فراتر از توافقنامههای کاغذی است.