امنیت سایبری و شبکه

پارادوکس مالکیت معنوی در عصر هوش مصنوعی: تحلیل فنی کمپین Distillation علیه OpenAI توسط Moonshot AI

در حالی که نبرد بر سر حاکمیت مدل‌های زبانی بزرگ (LLM) به اوج خود رسیده است، گزارش‌های اخیر از شناسایی و خنثی‌سازی یک کمپین «تقطیر خصمانه» (Adversarial Distillation) توسط OpenAI علیه شرکت چینی Moonshot AI، بحث‌های اخلاقی و فنی عمیقی را درباره مالکیت معنوی و امنیت مدل‌های هوش مصنوعی در تابستان ۱۴۰۵ برانگیخته است.

مفهوم تقطیر مدل (Model Distillation) در سناریوهای خصمانه

تقطیر مدل در دنیای یادگیری ماشین یک تکنیک استاندارد برای انتقال دانش از یک مدل بزرگ (Teacher) به یک مدل کوچک‌تر و بهینه‌تر (Student) است. اما در سناریوی اخیر، این فرآیند به شکلی متخاصم استفاده شده است. مهاجمان با ارسال حجم عظیمی از پرس‌وجوهای (Queries) هدفمند به رابط‌های برنامه‌نویسی OpenAI، سعی کردند الگوهای استنتاجی (Reasoning Patterns) مدل‌های این شرکت را استخراج کنند. این کار برخلاف استفاده‌های معمول، با هدف بازتولید قابلیت‌های استدلالی یک مدل قدرتمند در مدل دیگری انجام شده است تا بدون نیاز به هزینه‌های سنگین تحقیق و توسعه، مدل‌های رقیب به سطحی از هوشمندی مشابه دست یابند.

جزئیات فنی کمپین جولای ۲۰۲۶ (تیر و مرداد ۱۴۰۵)

طبق گزارش‌های منتشر شده در مهر ۱۴۰۵، این عملیات از تاریخ ۱ ژوئیه ۲۰۲۶ آغاز و تا ۲۸ ژوئیه ادامه داشت. OpenAI اعلام کرده است که مهاجمان از طریق بیش از ۱۵ هزار حساب کاربری، الگوهای پرس‌وجوی سازمان‌یافته‌ای را پیاده‌سازی کردند. اوج این حملات در ۲۴ و ۲۵ ژوئیه رخ داد که تنها در یک بازه کوتاه، ۱۶ هزار درخواست با الگوهای استخراجی مشابه ثبت شد. نکته کلیدی اینجاست که مهاجمان به دیتابیس یا کلیدهای رمزنگاری دسترسی پیدا نکردند، بلکه با مهندسی معکوس رفتار خروجی مدل (Input-Output manipulation)، توانستند ویژگی‌های خاص مدل را استخراج کنند.

مشخصات و ابعاد فنی نفوذ

  • نوع حمله: Adversarial Distillation (تقطیر خصمانه جهت استخراج Reasoning)
  • دوره فعالیت: ۱ تا ۲۸ ژوئیه ۲۰۲۶ (تیر ۱۴۰۵)
  • حجم ترافیک: بیش از ۱۵,۰۰۰ حساب کاربری درگیر با الگوهای پرس‌وجوی سازمان‌یافته
  • پلتفرم هدف: مدل‌های پایه و Reasoning-based شرکت OpenAI
  • اقدام دفاعی: بستن مسیرهای بازپخش استدلال (Encrypted Reasoning Replay) و افزایش محدودیت‌های زیرساختی

امنیت مدل‌ها و ریسک‌های دوگانه (Dual-Use)

یکی از بزرگ‌ترین نگرانی‌های مطرح شده توسط OpenAI و نهادهای نظارتی آمریکا، حذف «گاردریل‌های امنیتی» (Safety Guardrails) در مدل‌های استخراج‌شده است. وقتی یک مدل اصلی آموزش می‌بیند، لایه‌های نظارتی و امنیتی سنگینی بر خروجی‌های آن اعمال می‌شود. اما وقتی یک مدل رقیب از طریق تقطیرِ صرفاً خروجی‌ها آموزش داده شود، این لایه‌های امنیتی به مدل جدید منتقل نمی‌شوند. این امر پتانسیل ایجاد مدل‌هایی را فراهم می‌کند که در حوزه‌های «کاربرد دوگانه» (مانند ساخت بدافزار یا محتوای خطرناک) بدون محدودیت‌های اخلاقی عمل می‌کنند.

پاسخ OpenAI و تغییرات زیرساختی

OpenAI برای مقابله با این روند، اقدامات زیرساختی گسترده‌ای انجام داده است:

  • مسدودسازی حساب‌های مرتبط با فعالیت‌های مشکوک در مقیاس بالا.
  • اصلاح سیستم‌های احراز هویت و نرخ محدودکننده (Rate Limiting) در APIها.
  • بستن حفره‌ای که به کاربران اجازه می‌داد استدلال‌های رمزنگاری‌شده (Encrypted Reasoning) سایر کاربران را بازپخش و بازیابی کنند.
  • همکاری با Frontier Model Forum جهت اشتراک‌گذاری الگوهای این حملات با سایر توسعه‌دهندگان هوش مصنوعی برای جلوگیری از انتقال تهدید به پلتفرم‌های دیگر.

این حادثه بار دیگر این پرسش بنیادین را مطرح می‌کند: در صنعتی که خود بر پایه «خزش» (Scraping) داده‌های عمومی اینترنت بنا شده است، تعریف دقیق «سرقت مالکیت معنوی» در دنیای مدل‌های هوش مصنوعی تا چه حد مرزهای خاکستری دارد؟

📌 منبع و مطالعه بیشتر: گزارش کامل در The Register
حامد

حامد

مسئول مجله فناوری آسمان نقره‌ای