در دنیای امنیت هوش مصنوعی، کابوسهای شبانه به واقعیت میپیوندند؛ محققان OpenAI به تازگی از کشف نوع جدیدی از آسیبپذیری با نام «تزریق پرامپت خود-تکثیرشونده» پرده برداشتهاند که عملکردی مشابه کرمهای کامپیوتری (Worms) دارد. این یافته در مهرماه ۱۴۰۵ (سپتامبر ۲۰۲۶) منتشر شد و زنگ خطری جدی برای سیستمهای مبتنی بر عاملهای هوشمند (AI Agents) محسوب میشود.
مکانیسم عملکرد و ماهیت تهدید
تزریق پرامپت خود-تکثیرشونده (Self-Replicating Prompt Injection) فراتر از حملات استاندارد تزریق است. در حالی که در حملات معمول، مدل برای انجام یک اقدام غیرمجاز فریب میخورد، در این مدل حملاتی که توسط OpenAI شناسایی شده است، دستورات مخرب به گونهای طراحی شدهاند که مدل را وادار میکنند کد مخرب را در خروجیهای بعدی خود بازتولید کند. این یعنی اگر عامل هوش مصنوعی به منابع خارجی مانند ایمیل یا Slack دسترسی داشته باشد، میتواند این دستور را به نفر بعدی یا سیستم بعدی ارسال کند و به صورت زنجیرهای منتشر شود.
نمونههای عملیاتی و سناریوهای حمله
- حمله از طریق ایمیل: دستور مخرب در محتوای یک ایمیل پنهان شده و به عامل هوشمند دستور میدهد در پاسخهای بعدی، تمام متن دریافتی را دوباره درج کند، که منجر به بازتولید خودکار پرامپت مخرب میشود.
- حمله به سیستمهای فایل: در جریان ساخت فایل اکسل، مدل با مشاهده یک هشدار سیستم جعلی، نه تنها گزارشها را حذف میکند، بلکه کد مخرب را به فایلهای خروجی تزریق میکند.
- حمله چندمرحلهای (Multi-hop): استفاده از ابزارهایی مانند Slack برای هدایت مدل به سمت هدف مهاجم در طی یک سلسله عملیات ظاهراً مرتبط.
استراتژی دفاعی: استفاده از GPT-Red برای مقابله
شرکت OpenAI برای مقابله با این تهدید از مدل GPT-Red استفاده میکند. این ابزار در واقع یک عامل هوشمند «قرمز» (Red-teaming agent) است که با هدف شناسایی نقاط ضعف در مدلهای Frontier آموزش دیده است. رویکرد اتخاذ شده، یادگیری ماشینی تضادی (Adversarial Training) است؛ به این معنا که مدلهای آتی در طول فرآیند آموزش، با نمونههای واقعی این حملات مواجه میشوند تا نسبت به آنها مقاومتر شوند.
چالشهای پیش رو و ابهامات امنیتی
اگرچه OpenAI امیدوار است که این آموزشها مدلهای نسل بعد را مستحکمتر کند، اما یک نگرانی بنیادی وجود دارد: آیا آموزش مدل برای درک نحوه بازتولید پرامپتها باعث میشود مدلها در «پنهانکاری» (Stealthiness) در اجرای دستورات مخرب ماهرتر شوند؟ این پارادوکس در حوزه امنیت سایبری هوش مصنوعی به عنوان یک چالش بزرگ شناخته میشود. اگر مدل برای درک حمله، قابلیتهای پیچیدهتری کسب کند، ممکن است همان قابلیتها توسط مهاجمان برای دور زدن فیلترهای امنیتی مورد سوءاستفاده قرار گیرد.
نتیجهگیری برای زیرساختهای ابری
با گسترش استفاده از مدلهای زبانی در سیستمهای متصل به APIهای سازمانی، امنیت «کانکتورها» (Connectors) حیاتیتر از همیشه است. سازمانها باید بدانند که مدل هوش مصنوعی در این سناریوها صرفاً یک پردازشگر متن نیست، بلکه یک «عامل اجرایی» است که میتواند مانند یک بدافزار خودکار رفتار کند. نظارت دقیق بر خروجی مدلها پیش از انتشار در کانالهای عمومی و جداسازی محیطهای اجرایی (Sandboxing) برای عاملهای هوش مصنوعی، گامهای ضروری در برابر این تهدید نوظهور هستند.