🤖 آیا مدل‌های زبانی واقعاً دنیای بازی‌ها را درک می‌کنند؟

⚠️ هشدار به محققان: چرا دقت مدل‌های شناسایی پهپاد گاهی «واقعی» نیست؟

محققان در مطالعه‌ای جدید، چالش جالبی را در مورد «مدل‌های دنیای کد» (Code World Models) مطرح کرده‌اند. با وجود اینکه این مدل‌ها ممکن است در پیش‌بینی دقیق وضعیت بازی‌ها دقت بسیار بالایی داشته باشند، اما همچنان در حین بازی شکست می‌خورند! 🎮

نکته کلیدی اینجاست: حتی اگر مدل ۹۹٪ دقیق باشد، همان ۱٪ خطا در قوانین حیاتی بازی، باعث شکست سیستم می‌شود. محققان این پدیده را «شکاف بین تایید و درستی» نامیده‌اند و نشان دادند که با افزایش داده هم این مشکل به راحتی حل نمی‌شود، چون مدل‌های زبانی بیشتر شبیه به «مترجم قوانین» عمل می‌کنند تا «استنتاج‌گر قوانین».

این تحقیق گام مهمی برای درک محدودیت‌های LLMها در محیط‌های استدلالی و بازی‌سازی است. 🧠

‌نویسی

منبع: arXiv Machine Learning