محققان در یک پژوهش جدید و بسیار جذاب، پرده از یک راز بزرگ در یادگیری تقویتی (Reinforcement Learning) برداشتهاند. تا به حال فکر میکردیم عاملهای «مدل-آزاد» (Model-Free) فقط واکنش نشان میدهند، اما مقاله جدید نشان میدهد که این مدلها میتوانند بهطور خودکار توانایی «برنامهریزی» پیدا کنند!
نکته کلیدی اینجاست: معماری شبکههای عصبی با استفاده از «وضعیتهای نهفته رابطهای»، ساختار محیط را کشف کرده و عملاً قبل از اقدام، روی یک گرافِ یادگیریشده برنامهریزی میکنند. این یافته نهتنها دنیای RL را متحول میکند، بلکه شاید کلیدی باشد برای درک اینکه چطور مغز انسان از پاداشهای ساده، توانایی پیچیده برنامهریزی را استخراج میکند. 🚀
منبع: arXiv AI
