هوش مصنوعی و یادگیری ماشین

پیروزی مدل تصمیم‌گیر Jev در بازی Pokémon Red: فراتر از هوش مصنوعی مولد با رویکرد هیبریدی

در رویدادی خیره‌کننده در دنیای هوش مصنوعی، مدل تصمیم‌گیر Jev توانست در کمتر از یک هفته بازی کلاسیک Pokémon Red را به اتمام برساند. برخلاف مدل‌های زبانی بزرگ (LLM) که برای ماه‌ها در پیچیدگی‌های این بازی درجا می‌زدند، Jev با استفاده از یک معماری مبتنی بر احتمالات و با هدایت هوشمندانه مدل Claude Opus 5، موفق شد تا نخبگان (Elite Four) و قهرمان نهایی را شکست داده و نام خود را در تالار مشاهیر ثبت کند.

معماری فنی Jev: مدل تصمیم‌گیر در برابر مدل زبانی

برخلاف چت‌بات‌های متداول، Jev یک LLM نیست. این سیستم یک مدل تصمیم‌گیر (Decision Model) است که خروجی‌های خود را بر اساس یک لیست از گزینه‌های موجود و با تخصیص یک ضریب اطمینان (Confidence Figure) انتخاب می‌کند. این مدل به جای تحلیل متنی یا تصویری سنگین، تنها با مفاهیم و واقعیت‌های ارائه‌شده در لحظه کار می‌کند. این سبک طراحی باعث می‌شود تا Jev در سناریوهایی که نیاز به انتخاب دقیق از میان مجموعه‌ای از متغیرهای محدود دارد، بسیار سریع‌تر و بهینه‌تر از LLMها عمل کند.

نقش استراتژیک Claude Opus 5 به عنوان مربی

موفقیت Jev یک پیروزی مطلق برای یک مدل به تنهایی نبود. در مهر ۱۴۰۵ (سپتامبر ۲۰۲۶)، مشخص شد که مدل Claude Opus 5 نقشی حیاتی به عنوان یک «مربی» ایفا کرده است. در حالی که Jev بازی را کنترل می‌کرد، Claude به صورت مستمر لاگ‌های بازی را مانیتور کرده و گزینه‌ها و داده‌های ورودی را برای مدل تغییر می‌داد. این همکاری نشان می‌دهد که چگونه ترکیب هوش مصنوعی تخصصی (Decision Model) با هوش مصنوعی عمومی (LLM) می‌تواند بن‌بست‌های منطقی را بشکند.

مشخصات و نتایج اجرایی پروژه

  • مدل اصلی: Jev (مدل تصمیم‌گیر با اولویت احتمالات)
  • مدل نظارتی: Anthropic Claude Opus 5
  • زمان اتمام: کمتر از یک هفته (پایان در ۲ مهر ۱۴۰۵)
  • پلتفرم توسعه: Standard Agents Inc
  • قابلیت مشاهده: اجرای زنده در مرورگر یا ترمینال با دستور npx jev-plays-pokemon

چالش‌ها و بهینه‌سازی‌های سیستم

مسیر Jev به سوی پیروزی بدون خطا نبود. طبق لاگ‌های تغییرات (Changelog)، این سیستم ۴۷۴ بار اصلاح شد تا از رفتارهای تکراری جلوگیری شود. برای مثال، Jev در ابتدای مسیر ۵۳ بار متوالی به درب بسته برخورد کرد یا ۱۲۴ بار در عرض ۱۰ دقیقه از یک نردبان خاص بالا و پایین رفت. با مداخله Opus، بازه زمانی تصمیم‌گیری از یک ثانیه به هر شش ثانیه افزایش یافت تا Jev از حلقه‌های منطقی تکراری خارج شود. علاوه بر این، مشارکت کاربران در چت زنده نیز به عنوان ورودی‌های کمکی برای اصلاح لیست گزینه‌ها مورد استفاده قرار گرفت.

نتیجه‌گیری: مدل‌های تخصصی در برابر مدل‌های عمومی

تجربه Jev ثابت کرد که برای کارهای وظیفه‌محور (Task-oriented)، مدل‌های تصمیم‌گیر با دقت بسیار بالاتر و هزینه عملیاتی کمتر (حدود ۱ تا ۱.۷ دلار در هر ۲۴ ساعت) عمل می‌کنند. در حالی که LLMها در کارهای باز و خلاقانه می‌درخشند، پیروزی Jev راه را برای ظهور عامل‌های هوشمند (AI Agents) هیبریدی هموار کرده است که می‌توانند در محیط‌های پیچیده به جای «تولید متن»، بر «تولید اقدام صحیح» متمرکز شوند.

📌 منبع و مطالعه بیشتر: گزارش فنی Tom’s Hardware درباره مدل Jev
حامد

حامد

مسئول مجله فناوری آسمان نقره‌ای