در حالی که نبرد بر سر حاکمیت مدلهای زبانی بزرگ (LLM) به اوج خود رسیده است، گزارشهای اخیر از شناسایی و خنثیسازی یک کمپین «تقطیر خصمانه» (Adversarial Distillation) توسط OpenAI علیه شرکت چینی Moonshot AI، بحثهای اخلاقی و فنی عمیقی را درباره مالکیت معنوی و امنیت مدلهای هوش مصنوعی در تابستان ۱۴۰۵ برانگیخته است.
مفهوم تقطیر مدل (Model Distillation) در سناریوهای خصمانه
تقطیر مدل در دنیای یادگیری ماشین یک تکنیک استاندارد برای انتقال دانش از یک مدل بزرگ (Teacher) به یک مدل کوچکتر و بهینهتر (Student) است. اما در سناریوی اخیر، این فرآیند به شکلی متخاصم استفاده شده است. مهاجمان با ارسال حجم عظیمی از پرسوجوهای (Queries) هدفمند به رابطهای برنامهنویسی OpenAI، سعی کردند الگوهای استنتاجی (Reasoning Patterns) مدلهای این شرکت را استخراج کنند. این کار برخلاف استفادههای معمول، با هدف بازتولید قابلیتهای استدلالی یک مدل قدرتمند در مدل دیگری انجام شده است تا بدون نیاز به هزینههای سنگین تحقیق و توسعه، مدلهای رقیب به سطحی از هوشمندی مشابه دست یابند.
جزئیات فنی کمپین جولای ۲۰۲۶ (تیر و مرداد ۱۴۰۵)
طبق گزارشهای منتشر شده در مهر ۱۴۰۵، این عملیات از تاریخ ۱ ژوئیه ۲۰۲۶ آغاز و تا ۲۸ ژوئیه ادامه داشت. OpenAI اعلام کرده است که مهاجمان از طریق بیش از ۱۵ هزار حساب کاربری، الگوهای پرسوجوی سازمانیافتهای را پیادهسازی کردند. اوج این حملات در ۲۴ و ۲۵ ژوئیه رخ داد که تنها در یک بازه کوتاه، ۱۶ هزار درخواست با الگوهای استخراجی مشابه ثبت شد. نکته کلیدی اینجاست که مهاجمان به دیتابیس یا کلیدهای رمزنگاری دسترسی پیدا نکردند، بلکه با مهندسی معکوس رفتار خروجی مدل (Input-Output manipulation)، توانستند ویژگیهای خاص مدل را استخراج کنند.
مشخصات و ابعاد فنی نفوذ
- نوع حمله: Adversarial Distillation (تقطیر خصمانه جهت استخراج Reasoning)
- دوره فعالیت: ۱ تا ۲۸ ژوئیه ۲۰۲۶ (تیر ۱۴۰۵)
- حجم ترافیک: بیش از ۱۵,۰۰۰ حساب کاربری درگیر با الگوهای پرسوجوی سازمانیافته
- پلتفرم هدف: مدلهای پایه و Reasoning-based شرکت OpenAI
- اقدام دفاعی: بستن مسیرهای بازپخش استدلال (Encrypted Reasoning Replay) و افزایش محدودیتهای زیرساختی
امنیت مدلها و ریسکهای دوگانه (Dual-Use)
یکی از بزرگترین نگرانیهای مطرح شده توسط OpenAI و نهادهای نظارتی آمریکا، حذف «گاردریلهای امنیتی» (Safety Guardrails) در مدلهای استخراجشده است. وقتی یک مدل اصلی آموزش میبیند، لایههای نظارتی و امنیتی سنگینی بر خروجیهای آن اعمال میشود. اما وقتی یک مدل رقیب از طریق تقطیرِ صرفاً خروجیها آموزش داده شود، این لایههای امنیتی به مدل جدید منتقل نمیشوند. این امر پتانسیل ایجاد مدلهایی را فراهم میکند که در حوزههای «کاربرد دوگانه» (مانند ساخت بدافزار یا محتوای خطرناک) بدون محدودیتهای اخلاقی عمل میکنند.
پاسخ OpenAI و تغییرات زیرساختی
OpenAI برای مقابله با این روند، اقدامات زیرساختی گستردهای انجام داده است:
- مسدودسازی حسابهای مرتبط با فعالیتهای مشکوک در مقیاس بالا.
- اصلاح سیستمهای احراز هویت و نرخ محدودکننده (Rate Limiting) در APIها.
- بستن حفرهای که به کاربران اجازه میداد استدلالهای رمزنگاریشده (Encrypted Reasoning) سایر کاربران را بازپخش و بازیابی کنند.
- همکاری با Frontier Model Forum جهت اشتراکگذاری الگوهای این حملات با سایر توسعهدهندگان هوش مصنوعی برای جلوگیری از انتقال تهدید به پلتفرمهای دیگر.
این حادثه بار دیگر این پرسش بنیادین را مطرح میکند: در صنعتی که خود بر پایه «خزش» (Scraping) دادههای عمومی اینترنت بنا شده است، تعریف دقیق «سرقت مالکیت معنوی» در دنیای مدلهای هوش مصنوعی تا چه حد مرزهای خاکستری دارد؟