در حالی که مدلهای زبانی بزرگ (LLM) با بلعیدن تمامی متون موجود در اینترنت به مرزهای دانشی خود رسیدهاند، صنعت هوش مصنوعی با یک بنبست اساسی در درک جهان فیزیکی روبرو شده است. اکنون استارتاپهایی مانند Worldmodeldata بر این باورند که کلید حل این معمای پیچیده، نه در متون، بلکه در دادههای عظیم و دستنخوردهی «مهارتهای بازیسازی» کاربران در محیطهای سهبعدی نهفته است.
گذار از مدلهای زبانی به مدلهای جهانی (World Models)
محققان برجستهای همچون Fei-Fei Li و Yann LeCun معتقدند که هوش مصنوعی برای خروج از محدودیتهای متنی و ورود به دنیای فیزیکی (مانند هدایت خودروهای خودران یا کنترل بازوهای رباتیک)، نیازمند چیزی فراتر از قدرت پردازش کلمات است. برخلاف LLMها که تنها بر الگوهای زبانی تکیه دارند، مدلهای جهانی (World Models) باید بر «فیزیک دنیای واقعی» مسلط شوند. این یعنی مدل باید بفهمد که برای برداشتن یک شیء، چه میزان گشتاور (Torque) لازم است و چگونه یک جسم در فضای سهبعدی واکنش نشان میدهد. چالش اصلی در اینجا فقدان «دادههای علت و معلولی» (Cause and Consequence) در شبکه جهانی اینترنت است.
دادههای بازیسازی؛ معدن طلای آموزشی
شرکت نوپای Worldmodeldata با استراتژی متفاوتی وارد میدان شده است. این استارتاپ قصد دارد دادههای ورودی کنترلرها (Controller Inputs) و بازخوردهای حرکتی ثبتشده در بازیهای ویدئویی را جمعآوری و بستهبندی کند. منطق این کار ساده است: بازیهای ویدئویی، محیطهای شبیهسازیشدهای هستند که در آن بازیکنان با دقتهای متفاوت (از حرکات ناشیانه تا حرفهای) در حال تعامل با قوانین فیزیک (هرچند تقریبی) هستند. این دادهها میتوانند به عنوان یک پایگاه آموزشی عظیم برای مدلهای جهانی عمل کنند تا رفتار در موقعیتهای حاشیهای (Corner Cases) را بیاموزند.
مشخصات و ابعاد فنی رویکرد Worldmodeldata:
- منبع داده: ورودیهای آنالوگ/دیجیتال کنترلر، تلهمتری حرکت، و بازنماییهای بصری سهبعدی.
- حجم داده: بیش از یک میلیون ساعت داده لایسنس شده از استودیوهای بازیسازی.
- هدف: آموزش مدلهای هوش مصنوعی برای درک تعاملات فیزیکی (Pick-and-Place tasks).
- تمایز: جایگزینی روشهای آزمایشگاهی پرهزینه (سنسورهای انسانی) با دادههای انبوه بازیهای ویدئویی.
چالشهای فیزیک بازی در برابر واقعیت
با این حال، نگاه خوشبینانه به دادههای بازیسازی مخالفانی نیز دارد. Ming-Yu Liu، مدیر توسعه مدلهای جهانی در NVIDIA، نسبت به استفاده از فیزیک بازی برای کارهای نیازمند دقت بالا هشدار میدهد. به عقیده او، توسعهدهندگان بازی برای رسیدن به جذابیت بصری، از «میانبرهای فیزیکی» استفاده میکنند. برای مثال، زمانی که یک کاراکتر سیبی را برمیدارد، موتور بازی به ندرت جزئیات دقیق فشار وارده توسط هر انگشت را شبیهسازی میکند. از این رو، این دادهها برای تولید محتوای بصری عالی هستند، اما ممکن است برای کنترل دقیق رباتیک (Fine-grained motor control) گمراهکننده باشند.
نتیجهگیری و آینده
پاییز ۱۴۰۵ و فراتر از آن، زمان اثبات این فرضیه است که آیا «دادههای بازی» میتوانند آن «لحظه GPT» را برای مدلهای جهانی رقم بزنند یا خیر. مسیر پیش رو ترکیبی از دادههای کلان بازیها برای یادگیری کلیات حرکت و دادههای اختصاصی (Task-specific) برای بهینهسازی دقیق در محیطهای صنعتی خواهد بود. در حال حاضر، صنعت میان دو رویکرد ایستاده است: استفاده از موتورهای فیزیکی اختصاصی (مانند روش NVIDIA) یا بهرهگیری از اقیانوس دادههای بازیسازی.