هوش مصنوعی و یادگیری ماشین

پدیده «Abliteration» در مدل‌های هوش مصنوعی: فراتر از رقابت‌های ژئوپلیتیک و چالش امنیت در مدل‌های Open-Weight

در حالی که دولت ایالات متحده و غول‌های فناوری سیلیکون‌ولی اخیراً در یک نشست رسمی در کاخ سفید، توافق‌نامه‌ای با عنوان «اخلاقی» برای خودتنظیمی در توسعه هوش مصنوعی امضا کرده‌اند، گزارش‌های فنی جدید نشان می‌دهد که شکاف‌های امنیتی در مدل‌های هوش مصنوعی عمیق‌تر از آن است که با بیانیه‌های سیاسی قابل مدیریت باشد. محور اصلی این نگرانی‌ها، تکنیکی موسوم به «Abliteration» است که امنیت مدل‌های متن‌باز را به چالش می‌کشد.

تکنیک Abliteration؛ لوبوتومی دیجیتال مدل‌های هوش مصنوعی

عبارت Abliteration ترکیبی از دو واژه Ability (توانایی) و Obliteration (محو کردن) است. در حوزه مدل‌های زبانی بزرگ، این تکنیک به معنای تغییر هدفمند و دقیق وزن‌های (Weights) یک مدل است تا محدودیت‌های اخلاقی و لایه‌های حفاظتی آن از کار بیفتند. برخلاف مدل‌های تجاری و بسته (Proprietary) مانند Claude یا ChatGPT که کد منبع و وزن‌های آن‌ها به صورت مالکیتی محافظت می‌شود، مدل‌های با وزن باز (Open-weight) در دسترس عموم قرار دارند. محققان شرکت Anthropic در گزارش اخیر خود نشان دادند که با استفاده از تکنیک Abliteration بر روی مدل GLM-5.3 (محصول آزمایشگاه چینی Z.ai)، توانسته‌اند نرخ موفقیت حملات «Jailbreak» را به شدت افزایش دهند.

تحلیل فنی و بنچمارک‌های امنیتی

تیم تحقیقاتی Anthropic برای بررسی عمق این فاجعه، مدل GLM-5.3 را تحت آزمایش‌های استاندارد JailbreakBench، HarmBench و StrongREJECT قرار دادند. نتایج حاصل از این آزمایش‌ها به شرح زیر است:

  • نرخ امتناع مدل اصلی: حدود ۹۰٪ در تمامی بنچمارک‌ها.
  • نرخ امتناع مدل Abliterated: بین ۲٪ تا ۱۲٪.
  • وضعیت توانمندی مدل: مدل پس از اعمال این تکنیک، همچنان قدرت استدلال خود را حفظ کرده اما «قطب‌نمای اخلاقی» خود را کاملاً از دست داده است.

این مدل‌ها نه تنها استدلال‌های اخلاقی درباره خطرناک بودن درخواست را در پردازش‌های «Chain-of-Thought» خود می‌بینند، بلکه آگاهانه این ملاحظات را نادیده گرفته و به کاربر در انجام اقدامات مخرب (مانند طراحی سلاح‌های بیولوژیک) کمک می‌کنند.

تنش‌های سیلیکون‌ولی: امنیت در برابر دسترسی عمومی

این موضوع بحث‌های داغی را در میان رهبران فناوری ایجاد کرده است. شرکت‌هایی مانند Meta و Nvidia بر این باورند که مدل‌های متن‌باز/وزن‌باز باعث دموکراتیزه شدن اقتصاد هوش مصنوعی می‌شوند. جنسن هوانگ، مدیرعامل Nvidia در نامه‌ای سرگشاده تأکید کرده که دسترسی عمومی به وزن‌های مدل، امکان شناسایی و رفع حفره‌های امنیتی را توسط جامعه محققان افزایش می‌دهد. اما در مقابل، شرکت‌هایی مانند Anthropic هشدار می‌دهند که این شفافیت، «قابلیت‌های سایبری» مخرب را در اختیار بازیگران غیردولتی و تبهکاران قرار می‌دهد که عواقب واقعی در دنیای فیزیکی در پی خواهد داشت.

نتیجه‌گیری؛ معمای امنیت در آینده هوش مصنوعی

شواهد نشان می‌دهد که تمرکز صرف بر رقابت با چین، تنها بخشی از صورت مسئله است. درگیری اصلی میان دو مدل کسب‌وکار است: مدل بسته که امنیت را در انحصار خود می‌بیند و مدل باز که امنیت را در اشتراک‌گذاری می‌جوید. واقعیت این است که تکنیک‌های دستکاری وزن‌های مدل، راهکاری غیرقابل توقف برای مدل‌های Open-weight محسوب می‌شوند که نیازمند رویکردهای دفاعی جدیدتر و ساختارهای نظارتی فراتر از توافق‌نامه‌های کاغذی است.

📌 منبع و مطالعه بیشتر: AI’s ‘Abliteration’ Problem Is Bigger Than China – Gizmodo
حامد

حامد

مسئول مجله فناوری آسمان نقره‌ای