توسعهدهندهای با نام کاربری stmonty اخیراً موفق شده است با بهرهگیری از مدلهای جهانی (World Models) و معماری JEPA، یک هوش مصنوعی سبک را برای اجرای بازی کلاسیک Pokémon Red آموزش دهد. این پروژه که روی یک کارت گرافیک ردهبالای مصرفکننده یعنی RTX 3080 Ti پیادهسازی شده، نشاندهنده پتانسیل بالای مدلهای پارامتری کوچک در یادگیری محیطهای بصری پیچیده و تصمیمگیری مبتنی بر پیشبینی است.
معماری مدل و رویکرد مبتنی بر پیشبینی
هسته اصلی این پروژه بر پایه تحقیقات مدلهای جهانی است که توسط دانشمندان برجستهای همچون یان لکان (Yann LeCun) توسعه یافته است. برخلاف مدلهای زبانی بزرگ که فضای وسیعی را اشغال میکنند، این مدل تنها با ۱۲.۵ میلیون پارامتر طراحی شده است. استراتژی هوش مصنوعی برای درک محیط بازی، پیشبینی فریم بعدی نیست، بلکه از خلاصههای فشردهسازی شدهای استفاده میکند که تنها شامل ۱۹۲ عدد (مقدار) هستند. این رویکرد به مدل اجازه میدهد تا بدون نیاز به سختافزارهای پردازشی فوقسنگین، ساختار بصری و منطقِ فشار دادن کلیدها را درک کند.
مراحل آموزش: از حرکات تصادفی تا انتخاب هوشمندانه
فرآیند آموزش این مدل شامل پردازش ۴۲,۳۸۲ فریم خاکستری در بیش از ۱,۰۰۰ دور کوتاه بوده است. دادههای ورودی ترکیبی از مسیرهای اسکریپتنویسی شده، مسیرهای همراه با کلیدهای تصادفی و گشتزنیهای آزاد بود. نکته کلیدی در آموزش، گنجاندن حرکات تصادفی بود؛ چرا که اگر مدل فقط با دادههای «تمیز» آموزش میدید، نمیتوانست تفاوتِ کارکرد کلیدهای خاص (مانند B) در موقعیتهای حساس مانند دیالوگها را بیاموزد.
چالشهای برنامهریزی و استدلال در دنیای بازی
در هر دور از شبیهسازی، مدل ۵۱۲ نمونه برنامهریزی تولید میکند که پس از غربالگری، ۶۴ مورد نهایی انتخاب و در محیط شبیهساز اجرا میشوند. یکی از یافتههای مهم stmonty این است که خطاهای کوچک در پیشبینیهای مدل، به صورت نمایی انباشته میشوند. این مسئله منجر به دشواری در پیشبرد بازی در مراحل طولانیتر میشود. با این حال، مدل در نهایت موفق شد به صورت مستقل، فرآیند انتخاب موجود (Squirtle) را با موفقیت پشت سر بگذارد که در مقایسه با انتخاب تصادفی (نرخ موفقیت صفر)، دستاوردی قابل توجه برای یک مدل کوچک به شمار میرود.
مشخصات فنی پیادهسازی
- سختافزار میزبان: NVIDIA RTX 3080 Ti
- تعداد پارامترها: حدود ۱۲.۵ میلیون
- فریمهای آموزشی: ۴۲,۳۸۲ فریم سیاه و سفید
- معماری پایه: LeWorldModel / JEPA
- مخزن کد: lePokeRed
نتیجهگیری و آینده مدلهای کوچک
این پروژه ثابت میکند که برای حل مسائل خاص در محیطهای بازی، همیشه نیاز به مدلهای عظیم با میلیاردها پارامتر نیست. رویکرد استفاده از مدلهای کوچکتر که قابلیت اجرا روی سختافزارهای دسکتاپ را دارند، راه را برای محققان و علاقهمندان حوزه یادگیری ماشین باز کرده است. اگرچه عبور از مراحل طولانی بازی به دلیل افزایش نمایی دشواری برنامهریزی همچنان چالشبرانگیز است، اما این گام نخست، پتانسیل بالایی در شخصیسازی هوش مصنوعی برای کاربردهای محیطمحور دارد.