محققان روش جدیدی به نام SafeDSR معرفی کردهاند که یادگیری تقویتی (Reinforcement Learning) را در محیطهای واقعی هوشمندتر میکند. یکی از چالشهای بزرگ در RL، اعمال محدودیتهای ایمنی است که معمولاً با تغییر شرایط محیط، نیاز به بازآموزی سنگین شبکه دارد.
این متد جدید با استفاده از «Successor Representations»، به مدل اجازه میدهد بدون نیاز به آموزش کل شبکه، فقط با بهروزرسانی یک ماتریس وزن کوچک، خود را با تغییرات ساختار هزینه (Cost Structure) تطبیق دهد. این یعنی رباتها و عوامل هوشمند حالا میتوانند بسیار سریعتر و منعطفتر نسبت به موانع یا تغییرات محیطی واکنش نشان دهند. 🤖✨
منبع: arXiv Machine Learning
