در تابستان ۱۴۰۳، دنیای هوش مصنوعی شاهد یک رخداد امنیتی پیچیده بود که بار دیگر چالشهای بنیادین در حفاظت از مالکیت معنوی مدلهای زبانی بزرگ (LLM) را برجسته کرد. شرکت OpenAI در گزارشی فنی، از شناسایی یک کمپین هماهنگ توسط عوامل مرتبط با شرکت چینی Moonshot AI خبر داد که هدف آن استخراج «استدلالهای نهفته» (Hidden Reasoning) یا زنجیره تفکر اختصاصی مدلها از طریق تکنیک «تقطیر خصمانه» (Adversarial Distillation) بوده است.
استدلال نهفته و مفهوم تقطیر خصمانه چیست؟
آنچه OpenAI به عنوان «استدلال محافظتشده» تعریف میکند، رکورد داخلی مدل برای حل یک وظیفه خاص است که به صورت رمزنگاریشده در قالب یک بلوک داده به کلاینت ارسال میشود. این فرآیند به مدل اجازه میدهد بدون نیاز به ذخیرهسازی وضعیت توسط سرور، استدلال خود را در درخواستهای بعدی بازیابی کند. تکنیک «تقطیر خصمانه» زمانی رخ میدهد که مهاجم با استفاده غیرمجاز از خروجیها یا فرآیندهای استدلالی یک مدل قدرتمند (Frontier Model)، سعی میکند یک مدل ضعیفتر و کوچکتر را آموزش داده یا بهبود ببخشد تا رفتارهای مدل اصلی را شبیهسازی کند.
جزئیات عملیات استخراج؛ از نفوذ تا مسدودسازی
فعالیتهای شناسایی شده در ابتدای تیر ماه ۱۴۰۳ با حجم پایین آغاز شد، اما در روزهای ۳ و ۴ مرداد ۱۴۰۳ (۲۴ و ۲۵ جولای) به اوج خود رسید. در این بازه زمانی، حدود ۱۶ هزار درخواست مشکوک توسط بیش از ۴ هزار کاربر مختلف ثبت شد. مهاجمان تلاش میکردند با جابهجایی بلوکهای رمزنگاریشده بین مکالمات مختلف و ترغیب مدل به رمزگشایی استدلالهای مدل دیگر، به محتوای Chain of Thought دسترسی پیدا کنند. OpenAI تاکید کرده است که رمزنگاری دادهها شکسته نشده و هیچ پایگاه دادهای مستقیماً هک نشده است، اما این کمپین تا ۲۸ تیر ماه ۱۴۰۳ بهطور کامل مختل و مسیرهای نفوذ مسدود گردید.
مشخصات فنی و اقدامات حفاظتی OpenAI
- نوع حمله: تقطیر خصمانه (Adversarial Distillation) و حملات بازپخش (Replay Attacks).
- حجم ترافیک: اوج ۱۶ هزار درخواست در دو روز طی جولای ۲۰۲۴.
- راهکار امنیتی ۱: مسدودسازی مسیر سوءاستفاده از بازپخش استدلالهای رمزنگاری شده متعلق به کاربران دیگر.
- راهکار امنیتی ۲: پیادهسازی فیلترهای جدید برای شناسایی و جلوگیری از خروجیهای استریم شده که حاوی آثار استدلالی هستند.
- اقدام ساختاری: تقویت پروتکلهای حفاظت از استدلال در سطح Workspace و سازمانها.
همکاریهای بینالمللی و گزارشهای مکمل
این رخداد تنها محدود به OpenAI نبوده است. شرکت Anthropic نیز در گزارش سپتامبر ۲۰۲۶ (معادل شهریور ۱۴۰۵) خود به جزئیاتی از ۳۰۰ هزار درخواست مشکوک اشاره کرده که از طریق شبکه پروکسی متشکل از ۵۳۸۰ حساب کاربری جعلی به مدل Claude ارسال شده بود. محققان امنیتی مستقل نیز با ارائه مقاله علمی «سرقت ردپای استدلالی از APIهای LLM اختصاصی»، ثابت کردند که مدلهای ضعیفتر قادرند با دریافت دادههای رمزنگاری شده از مدلهای پیشرو، آنها را به متن ساده تبدیل کنند. این یافتهها نشاندهنده یک الگوی تکرارشونده در صنعت است که مدلهای چینی با هدف میانبر زدن مسیر تحقیق و توسعه از آن بهره میبرند.
چشمانداز آینده و امنیت زیرساخت مدلهای زبانی
OpenAI اکنون در حال بازنگری در مدلهای استقرار یافته توسط شرکای ثالث است تا اطمینان حاصل کند که پروتکلهای امنیتی مشابه با ابزارهای داخلی اعمال میشود. تهدیدات ناشی از «استدلالهای قابل حمل» (Portable Reasoning Artifacts) یک چالش مداوم برای توسعهدهندگان هوش مصنوعی خواهد بود. همانطور که مدلها پیشرفتهتر میشوند، انگیزهها برای تقطیر و کپیبرداری خصمانه نیز افزایش مییابد؛ امری که منجر به ایجاد استانداردهای جدید در تبادل دادههای مدل و نظارت دقیقتر بر ترافیک APIها در فضای ابری شده است.