در رویدادی خیرهکننده در دنیای هوش مصنوعی، مدل تصمیمگیر Jev توانست در کمتر از یک هفته بازی کلاسیک Pokémon Red را به اتمام برساند. برخلاف مدلهای زبانی بزرگ (LLM) که برای ماهها در پیچیدگیهای این بازی درجا میزدند، Jev با استفاده از یک معماری مبتنی بر احتمالات و با هدایت هوشمندانه مدل Claude Opus 5، موفق شد تا نخبگان (Elite Four) و قهرمان نهایی را شکست داده و نام خود را در تالار مشاهیر ثبت کند.
معماری فنی Jev: مدل تصمیمگیر در برابر مدل زبانی
برخلاف چتباتهای متداول، Jev یک LLM نیست. این سیستم یک مدل تصمیمگیر (Decision Model) است که خروجیهای خود را بر اساس یک لیست از گزینههای موجود و با تخصیص یک ضریب اطمینان (Confidence Figure) انتخاب میکند. این مدل به جای تحلیل متنی یا تصویری سنگین، تنها با مفاهیم و واقعیتهای ارائهشده در لحظه کار میکند. این سبک طراحی باعث میشود تا Jev در سناریوهایی که نیاز به انتخاب دقیق از میان مجموعهای از متغیرهای محدود دارد، بسیار سریعتر و بهینهتر از LLMها عمل کند.
نقش استراتژیک Claude Opus 5 به عنوان مربی
موفقیت Jev یک پیروزی مطلق برای یک مدل به تنهایی نبود. در مهر ۱۴۰۵ (سپتامبر ۲۰۲۶)، مشخص شد که مدل Claude Opus 5 نقشی حیاتی به عنوان یک «مربی» ایفا کرده است. در حالی که Jev بازی را کنترل میکرد، Claude به صورت مستمر لاگهای بازی را مانیتور کرده و گزینهها و دادههای ورودی را برای مدل تغییر میداد. این همکاری نشان میدهد که چگونه ترکیب هوش مصنوعی تخصصی (Decision Model) با هوش مصنوعی عمومی (LLM) میتواند بنبستهای منطقی را بشکند.
مشخصات و نتایج اجرایی پروژه
- مدل اصلی: Jev (مدل تصمیمگیر با اولویت احتمالات)
- مدل نظارتی: Anthropic Claude Opus 5
- زمان اتمام: کمتر از یک هفته (پایان در ۲ مهر ۱۴۰۵)
- پلتفرم توسعه: Standard Agents Inc
- قابلیت مشاهده: اجرای زنده در مرورگر یا ترمینال با دستور
npx jev-plays-pokemon
چالشها و بهینهسازیهای سیستم
مسیر Jev به سوی پیروزی بدون خطا نبود. طبق لاگهای تغییرات (Changelog)، این سیستم ۴۷۴ بار اصلاح شد تا از رفتارهای تکراری جلوگیری شود. برای مثال، Jev در ابتدای مسیر ۵۳ بار متوالی به درب بسته برخورد کرد یا ۱۲۴ بار در عرض ۱۰ دقیقه از یک نردبان خاص بالا و پایین رفت. با مداخله Opus، بازه زمانی تصمیمگیری از یک ثانیه به هر شش ثانیه افزایش یافت تا Jev از حلقههای منطقی تکراری خارج شود. علاوه بر این، مشارکت کاربران در چت زنده نیز به عنوان ورودیهای کمکی برای اصلاح لیست گزینهها مورد استفاده قرار گرفت.
نتیجهگیری: مدلهای تخصصی در برابر مدلهای عمومی
تجربه Jev ثابت کرد که برای کارهای وظیفهمحور (Task-oriented)، مدلهای تصمیمگیر با دقت بسیار بالاتر و هزینه عملیاتی کمتر (حدود ۱ تا ۱.۷ دلار در هر ۲۴ ساعت) عمل میکنند. در حالی که LLMها در کارهای باز و خلاقانه میدرخشند، پیروزی Jev راه را برای ظهور عاملهای هوشمند (AI Agents) هیبریدی هموار کرده است که میتوانند در محیطهای پیچیده به جای «تولید متن»، بر «تولید اقدام صحیح» متمرکز شوند.