آیا هوش مصنوعی میتواند در بازیهای طولانیمدت، «استادانه» تصمیم بگیرد؟ محققان بهتازگی راهکار خلاقانهای به نام CAST (مخفف Credit Assignment from Solver Teachers) را معرفی کردهاند که یادگیری مدلهای زبانی بزرگ (LLM) را برای محیطهای بازی متحول میکند.
تکنیکهای سنتی معمولاً به پاداشهای نهایی متکی هستند که در طول مسیر، جزئیات کمی درباره نحوه موفقیت به هوش مصنوعی میدهند. اما «CAST» با استفاده از یک تحلیلگر داخلی (Solver)، تغییرات وضعیت بازی را به سیگنالهای آموزشی دقیق در هر مرحله تبدیل میکند.
نتایج این تحقیق نشان میدهد که CAST نه تنها در بازیهای کلاسیک مثل «سوکوبان» و «مینروب» از مدلهای فعلی پیشی گرفته، بلکه در محیطهای تصمیمگیری چندمرحلهای مثل ALFWorld و WebShop هم عملکرد خیرهکنندهای داشته است.
این پیشرفت یعنی مدلهای زبانی در آینده میتوانند در سناریوهای پیچیدهتر و دنیای واقعی، تصمیمات منطقیتر و دقیقتری بگیرند.
🔗 لینک کد پروژه: https://github.com/Wloner0809/CAST
منبع: arXiv AI
