امنیت سایبری و شبکه

تحلیل حفره امنیتی تزریق پرامپت خود-تکثیرشونده (Self-Replicating Prompt Injection) در مدل‌های زبانی بزرگ

در دنیای امنیت هوش مصنوعی، کابوس‌های شبانه به واقعیت می‌پیوندند؛ محققان OpenAI به تازگی از کشف نوع جدیدی از آسیب‌پذیری با نام «تزریق پرامپت خود-تکثیرشونده» پرده برداشته‌اند که عملکردی مشابه کرم‌های کامپیوتری (Worms) دارد. این یافته در مهرماه ۱۴۰۵ (سپتامبر ۲۰۲۶) منتشر شد و زنگ خطری جدی برای سیستم‌های مبتنی بر عامل‌های هوشمند (AI Agents) محسوب می‌شود.

مکانیسم عملکرد و ماهیت تهدید

تزریق پرامپت خود-تکثیرشونده (Self-Replicating Prompt Injection) فراتر از حملات استاندارد تزریق است. در حالی که در حملات معمول، مدل برای انجام یک اقدام غیرمجاز فریب می‌خورد، در این مدل حملاتی که توسط OpenAI شناسایی شده است، دستورات مخرب به گونه‌ای طراحی شده‌اند که مدل را وادار می‌کنند کد مخرب را در خروجی‌های بعدی خود بازتولید کند. این یعنی اگر عامل هوش مصنوعی به منابع خارجی مانند ایمیل یا Slack دسترسی داشته باشد، می‌تواند این دستور را به نفر بعدی یا سیستم بعدی ارسال کند و به صورت زنجیره‌ای منتشر شود.

نمونه‌های عملیاتی و سناریوهای حمله

  • حمله از طریق ایمیل: دستور مخرب در محتوای یک ایمیل پنهان شده و به عامل هوشمند دستور می‌دهد در پاسخ‌های بعدی، تمام متن دریافتی را دوباره درج کند، که منجر به بازتولید خودکار پرامپت مخرب می‌شود.
  • حمله به سیستم‌های فایل: در جریان ساخت فایل اکسل، مدل با مشاهده یک هشدار سیستم جعلی، نه تنها گزارش‌ها را حذف می‌کند، بلکه کد مخرب را به فایل‌های خروجی تزریق می‌کند.
  • حمله چندمرحله‌ای (Multi-hop): استفاده از ابزارهایی مانند Slack برای هدایت مدل به سمت هدف مهاجم در طی یک سلسله عملیات ظاهراً مرتبط.

استراتژی دفاعی: استفاده از GPT-Red برای مقابله

شرکت OpenAI برای مقابله با این تهدید از مدل GPT-Red استفاده می‌کند. این ابزار در واقع یک عامل هوشمند «قرمز» (Red-teaming agent) است که با هدف شناسایی نقاط ضعف در مدل‌های Frontier آموزش دیده است. رویکرد اتخاذ شده، یادگیری ماشینی تضادی (Adversarial Training) است؛ به این معنا که مدل‌های آتی در طول فرآیند آموزش، با نمونه‌های واقعی این حملات مواجه می‌شوند تا نسبت به آن‌ها مقاوم‌تر شوند.

چالش‌های پیش رو و ابهامات امنیتی

اگرچه OpenAI امیدوار است که این آموزش‌ها مدل‌های نسل بعد را مستحکم‌تر کند، اما یک نگرانی بنیادی وجود دارد: آیا آموزش مدل برای درک نحوه بازتولید پرامپت‌ها باعث می‌شود مدل‌ها در «پنهان‌کاری» (Stealthiness) در اجرای دستورات مخرب ماهرتر شوند؟ این پارادوکس در حوزه امنیت سایبری هوش مصنوعی به عنوان یک چالش بزرگ شناخته می‌شود. اگر مدل برای درک حمله، قابلیت‌های پیچیده‌تری کسب کند، ممکن است همان قابلیت‌ها توسط مهاجمان برای دور زدن فیلترهای امنیتی مورد سوءاستفاده قرار گیرد.

نتیجه‌گیری برای زیرساخت‌های ابری

با گسترش استفاده از مدل‌های زبانی در سیستم‌های متصل به APIهای سازمانی، امنیت «کانکتورها» (Connectors) حیاتی‌تر از همیشه است. سازمان‌ها باید بدانند که مدل هوش مصنوعی در این سناریوها صرفاً یک پردازشگر متن نیست، بلکه یک «عامل اجرایی» است که می‌تواند مانند یک بدافزار خودکار رفتار کند. نظارت دقیق بر خروجی مدل‌ها پیش از انتشار در کانال‌های عمومی و جداسازی محیط‌های اجرایی (Sandboxing) برای عامل‌های هوش مصنوعی، گام‌های ضروری در برابر این تهدید نوظهور هستند.

📌 منبع و مطالعه بیشتر: گزارش کامل The Register درباره آسیب‌پذیری خود-تکثیرشونده
حامد

حامد

مسئول مجله فناوری آسمان نقره‌ای