محققان در مطالعهای جدید، عملکرد چهار مدل یادگیری تقویتشده (RL) را روی بازی سنتی و استراتژیک «باگچال» (Baghchal) بررسی کردند. این بازی که اصالتی نپالی دارد، به دلیل ساختار نامتقارن و پیچیدهاش، چالش بزرگی برای هوش مصنوعی محسوب میشود.
نتایج جالب این پژوهش:
🔹 مدل MuZero با تکیه بر برنامهریزی مدلمحور و جستجوی درخت مونتکارلو (MCTS)، بهترین عملکرد را ثبت کرد.
🔹 مدل PPO نیز به عنوان گزینهای اقتصادیتر و رقابتی، با هزینه محاسباتی بسیار کمتر، در هر دو نقش ببر و بز خوش درخشید.
🔹 این مطالعه نشان داد که مدلهای مبتنی بر ارزش (مانند DQN) بیشتر در نقش «ببر» که پاداشهای ملموستری دارد، موفقتر عمل میکنند.
این نوع تحقیقات به ما کمک میکند تا بفهمیم ایجنتهای هوش مصنوعی چطور میتوانند در محیطهای پیچیده و رقابتی دنیای واقعی، استراتژیهای بهینه ابداع کنند.
منبع: arXiv AI
