امنیت سایبری و شبکه

نبرد پنهان در دنیای LLMها: واکاوی کمپین استخراج «استدلال نهفته» از مدل‌های OpenAI توسط عوامل وابسته به Moonshot AI

در تابستان ۱۴۰۳، دنیای هوش مصنوعی شاهد یک رخداد امنیتی پیچیده بود که بار دیگر چالش‌های بنیادین در حفاظت از مالکیت معنوی مدل‌های زبانی بزرگ (LLM) را برجسته کرد. شرکت OpenAI در گزارشی فنی، از شناسایی یک کمپین هماهنگ توسط عوامل مرتبط با شرکت چینی Moonshot AI خبر داد که هدف آن استخراج «استدلال‌های نهفته» (Hidden Reasoning) یا زنجیره تفکر اختصاصی مدل‌ها از طریق تکنیک «تقطیر خصمانه» (Adversarial Distillation) بوده است.

استدلال نهفته و مفهوم تقطیر خصمانه چیست؟

آنچه OpenAI به عنوان «استدلال محافظت‌شده» تعریف می‌کند، رکورد داخلی مدل برای حل یک وظیفه خاص است که به صورت رمزنگاری‌شده در قالب یک بلوک داده به کلاینت ارسال می‌شود. این فرآیند به مدل اجازه می‌دهد بدون نیاز به ذخیره‌سازی وضعیت توسط سرور، استدلال خود را در درخواست‌های بعدی بازیابی کند. تکنیک «تقطیر خصمانه» زمانی رخ می‌دهد که مهاجم با استفاده غیرمجاز از خروجی‌ها یا فرآیندهای استدلالی یک مدل قدرتمند (Frontier Model)، سعی می‌کند یک مدل ضعیف‌تر و کوچک‌تر را آموزش داده یا بهبود ببخشد تا رفتارهای مدل اصلی را شبیه‌سازی کند.

جزئیات عملیات استخراج؛ از نفوذ تا مسدودسازی

فعالیت‌های شناسایی شده در ابتدای تیر ماه ۱۴۰۳ با حجم پایین آغاز شد، اما در روزهای ۳ و ۴ مرداد ۱۴۰۳ (۲۴ و ۲۵ جولای) به اوج خود رسید. در این بازه زمانی، حدود ۱۶ هزار درخواست مشکوک توسط بیش از ۴ هزار کاربر مختلف ثبت شد. مهاجمان تلاش می‌کردند با جابه‌جایی بلوک‌های رمزنگاری‌شده بین مکالمات مختلف و ترغیب مدل به رمزگشایی استدلال‌های مدل دیگر، به محتوای Chain of Thought دسترسی پیدا کنند. OpenAI تاکید کرده است که رمزنگاری داده‌ها شکسته نشده و هیچ پایگاه داده‌ای مستقیماً هک نشده است، اما این کمپین تا ۲۸ تیر ماه ۱۴۰۳ به‌طور کامل مختل و مسیرهای نفوذ مسدود گردید.

مشخصات فنی و اقدامات حفاظتی OpenAI

  • نوع حمله: تقطیر خصمانه (Adversarial Distillation) و حملات بازپخش (Replay Attacks).
  • حجم ترافیک: اوج ۱۶ هزار درخواست در دو روز طی جولای ۲۰۲۴.
  • راهکار امنیتی ۱: مسدودسازی مسیر سوءاستفاده از بازپخش استدلال‌های رمزنگاری شده متعلق به کاربران دیگر.
  • راهکار امنیتی ۲: پیاده‌سازی فیلترهای جدید برای شناسایی و جلوگیری از خروجی‌های استریم شده که حاوی آثار استدلالی هستند.
  • اقدام ساختاری: تقویت پروتکل‌های حفاظت از استدلال در سطح Workspace و سازمان‌ها.

همکاری‌های بین‌المللی و گزارش‌های مکمل

این رخداد تنها محدود به OpenAI نبوده است. شرکت Anthropic نیز در گزارش سپتامبر ۲۰۲۶ (معادل شهریور ۱۴۰۵) خود به جزئیاتی از ۳۰۰ هزار درخواست مشکوک اشاره کرده که از طریق شبکه پروکسی متشکل از ۵۳۸۰ حساب کاربری جعلی به مدل Claude ارسال شده بود. محققان امنیتی مستقل نیز با ارائه مقاله علمی «سرقت ردپای استدلالی از APIهای LLM اختصاصی»، ثابت کردند که مدل‌های ضعیف‌تر قادرند با دریافت داده‌های رمزنگاری شده از مدل‌های پیشرو، آن‌ها را به متن ساده تبدیل کنند. این یافته‌ها نشان‌دهنده یک الگوی تکرارشونده در صنعت است که مدل‌های چینی با هدف میان‌بر زدن مسیر تحقیق و توسعه از آن بهره می‌برند.

چشم‌انداز آینده و امنیت زیرساخت مدل‌های زبانی

OpenAI اکنون در حال بازنگری در مدل‌های استقرار یافته توسط شرکای ثالث است تا اطمینان حاصل کند که پروتکل‌های امنیتی مشابه با ابزارهای داخلی اعمال می‌شود. تهدیدات ناشی از «استدلال‌های قابل حمل» (Portable Reasoning Artifacts) یک چالش مداوم برای توسعه‌دهندگان هوش مصنوعی خواهد بود. همان‌طور که مدل‌ها پیشرفته‌تر می‌شوند، انگیزه‌ها برای تقطیر و کپی‌برداری خصمانه نیز افزایش می‌یابد؛ امری که منجر به ایجاد استانداردهای جدید در تبادل داده‌های مدل و نظارت دقیق‌تر بر ترافیک APIها در فضای ابری شده است.

📌 منبع و مطالعه بیشتر: گزارش Tom’s Hardware درباره کمپین Moonshot AI
حامد

حامد

مسئول مجله فناوری آسمان نقره‌ای