هوش مصنوعی و یادگیری ماشین

آموزش مدل هوش مصنوعی برای تجربه بازی Pokémon Red روی کارت گرافیک‌های خانگی

توسعه‌دهنده‌ای با نام کاربری stmonty اخیراً موفق شده است با بهره‌گیری از مدل‌های جهانی (World Models) و معماری JEPA، یک هوش مصنوعی سبک را برای اجرای بازی کلاسیک Pokémon Red آموزش دهد. این پروژه که روی یک کارت گرافیک رده‌بالای مصرف‌کننده یعنی RTX 3080 Ti پیاده‌سازی شده، نشان‌دهنده پتانسیل بالای مدل‌های پارامتری کوچک در یادگیری محیط‌های بصری پیچیده و تصمیم‌گیری مبتنی بر پیش‌بینی است.

معماری مدل و رویکرد مبتنی بر پیش‌بینی

هسته اصلی این پروژه بر پایه تحقیقات مدل‌های جهانی است که توسط دانشمندان برجسته‌ای همچون یان لکان (Yann LeCun) توسعه یافته است. برخلاف مدل‌های زبانی بزرگ که فضای وسیعی را اشغال می‌کنند، این مدل تنها با ۱۲.۵ میلیون پارامتر طراحی شده است. استراتژی هوش مصنوعی برای درک محیط بازی، پیش‌بینی فریم بعدی نیست، بلکه از خلاصه‌های فشرده‌سازی شده‌ای استفاده می‌کند که تنها شامل ۱۹۲ عدد (مقدار) هستند. این رویکرد به مدل اجازه می‌دهد تا بدون نیاز به سخت‌افزارهای پردازشی فوق‌سنگین، ساختار بصری و منطقِ فشار دادن کلیدها را درک کند.

مراحل آموزش: از حرکات تصادفی تا انتخاب هوشمندانه

فرآیند آموزش این مدل شامل پردازش ۴۲,۳۸۲ فریم خاکستری در بیش از ۱,۰۰۰ دور کوتاه بوده است. داده‌های ورودی ترکیبی از مسیرهای اسکریپت‌نویسی شده، مسیرهای همراه با کلیدهای تصادفی و گشت‌زنی‌های آزاد بود. نکته کلیدی در آموزش، گنجاندن حرکات تصادفی بود؛ چرا که اگر مدل فقط با داده‌های «تمیز» آموزش می‌دید، نمی‌توانست تفاوتِ کارکرد کلیدهای خاص (مانند B) در موقعیت‌های حساس مانند دیالوگ‌ها را بیاموزد.

چالش‌های برنامه‌ریزی و استدلال در دنیای بازی

در هر دور از شبیه‌سازی، مدل ۵۱۲ نمونه برنامه‌ریزی تولید می‌کند که پس از غربال‌گری، ۶۴ مورد نهایی انتخاب و در محیط شبیه‌ساز اجرا می‌شوند. یکی از یافته‌های مهم stmonty این است که خطاهای کوچک در پیش‌بینی‌های مدل، به صورت نمایی انباشته می‌شوند. این مسئله منجر به دشواری در پیش‌برد بازی در مراحل طولانی‌تر می‌شود. با این حال، مدل در نهایت موفق شد به صورت مستقل، فرآیند انتخاب موجود (Squirtle) را با موفقیت پشت سر بگذارد که در مقایسه با انتخاب تصادفی (نرخ موفقیت صفر)، دستاوردی قابل توجه برای یک مدل کوچک به شمار می‌رود.

مشخصات فنی پیاده‌سازی

  • سخت‌افزار میزبان: NVIDIA RTX 3080 Ti
  • تعداد پارامترها: حدود ۱۲.۵ میلیون
  • فریم‌های آموزشی: ۴۲,۳۸۲ فریم سیاه و سفید
  • معماری پایه: LeWorldModel / JEPA
  • مخزن کد: lePokeRed

نتیجه‌گیری و آینده مدل‌های کوچک

این پروژه ثابت می‌کند که برای حل مسائل خاص در محیط‌های بازی، همیشه نیاز به مدل‌های عظیم با میلیاردها پارامتر نیست. رویکرد استفاده از مدل‌های کوچک‌تر که قابلیت اجرا روی سخت‌افزارهای دسکتاپ را دارند، راه را برای محققان و علاقه‌مندان حوزه یادگیری ماشین باز کرده است. اگرچه عبور از مراحل طولانی بازی به دلیل افزایش نمایی دشواری برنامه‌ریزی همچنان چالش‌برانگیز است، اما این گام نخست، پتانسیل بالایی در شخصی‌سازی هوش مصنوعی برای کاربردهای محیط‌محور دارد.

📌 منبع و مطالعه بیشتر: Tom’s Hardware: Training AI to Play Pokémon Red
حامد

حامد

مسئول مجله فناوری آسمان نقره‌ای