دنیای هوش مصنوعی در مهر ۱۴۰۵ (اکتبر ۲۰۲۶) شاهد یک دستاورد بزرگ در حوزه تئوری بازیهاست. محققان دانشگاههای کارنگی ملون، امآیتی، نیویورک و استنفورد با معرفی سامانه هوشمند «آتاراکسوس» (Ataraxos) موفق شدند یکی از پیچیدهترین بازیهای استراتژیک دارای اطلاعات ناقص، یعنی «استراتگو» (Stratego) را به شکلی کاملاً بهینه حل کنند.
معماری نوآورانه Ataraxos و غلبه بر اطلاعات ناقص
بازی استراتگو برخلاف شطرنج یا گو که در آنها تمام مهرهها برای طرفین قابل مشاهده است، شامل اطلاعات پنهان (Hidden Information) است. این یعنی بازیکن باید بر اساس حرکات حریف، هویت مهرههای او را حدس بزند. آتاراکسوس با استفاده از یک ساختار عصبی دوگانه توانست بر این چالش غلبه کند. بخش اول این سیستم همانند هوش مصنوعیهای پیشین، از طریق بازی با خود (Self-play) یاد میگیرد، اما نوآوری اصلی در بخش دوم نهفته است: یک «مدل باور» (Belief Model) که وظیفه دارد احتمالات مربوط به ترکیب مهرههای حریف را به صورت پویا تخمین بزند.
تحول در استراتژی جستجو و بهینهسازی محاسباتی
برخلاف DeepNash که توسط DeepMind معرفی شده بود، آتاراکسوس قادر است قبل از هر حرکت، «پیشبینی» (Thinking Ahead) داشته باشد. در گذشته تصور میشد فضای جستجوی استراتگو آنقدر بزرگ است که جستجوی درختی (Search) در آن غیرممکن است. تیم تحقیقاتی با ترکیب مدل باور و الگوریتمهای نمونهبرداری، بهجای بررسی تمامی حالات ممکن (Brute-force)، تنها سناریوهای محتمل را شبیهسازی کرده و بهترین حرکت را انتخاب میکند. این مدل بهمراتب کارآمدتر از رویکردهای قدیمی است و توانست قهرمان جهان، پیم نیمیر، را با نتیجه ۱۵ بر ۱ شکست دهد.
بهرهوری فوقالعاده در آموزش و منابع سختافزاری
یکی از درخشانترین ابعاد این پژوهش، هزینهی آموزش پایین آن نسبت به غولهای فناوری است. در حالی که مدلهای مشابه نیازمند هزاران تراشه تخصصی با هزینههای میلیون دلاری هستند، آتاراکسوس تنها با ۱۶ پردازنده گرافیکی (GPU) در مدت یک هفته آموزش دید. این بهرهوری مدیون توسعه یک شبیهساز اختصاصی است که قادر است میلیونها حرکت در ثانیه را روی کارتهای گرافیک معمولی پردازش کند. این پیشرفت ثابت میکند که تحقیقات آکادمیک با الگوریتمهای هوشمندانه میتوانند حتی در مقیاسهای کوچکتر، نتایجی فراتر از ابرپروژههای صنعتی کسب کنند.
مشخصات فنی و یافتههای کلیدی:
- نام پروژه: Ataraxos
- روش یادگیری: Self-play با نرخ یادگیری متغیر (بزرگ در شروع، کوچک در انتها)
- نوآوری اصلی: استفاده از Belief Model برای کاهش فضای جستجوی اطلاعات پنهان
- منابع سختافزاری: ۱۶ عدد GPU برای هسته یادگیری + ۴ عدد GPU برای مدل باور
- عملکرد: ۱۵ برد، ۱ باخت و ۴ تساوی در برابر قهرمان جهانی استراتگو
آینده هوش مصنوعی در بازیهای با اطلاعات ناقص
دستاورد آتاراکسوس تنها به یک بازی رومیزی محدود نمیشود. این الگوریتم راه را برای کاربردهای واقعی هوش مصنوعی در حوزههایی که «عدم قطعیت» و «اطلاعات ناقص» حرف اول را میزنند، باز میکند؛ مواردی مانند امنیت سایبری، مذاکرات اقتصادی و مدیریت منابع در شبکههای پیچیده. آتاراکسوس ثابت کرد که نبوغ در طراحی مدل، میتواند محدودیتهای عظیم محاسباتی را به چالش بکشد.