محققان در مقالهای جدید به سراغ حل یکی از چالشهای بزرگ در مدلهای جهانمحور (World Models) رفتهاند. مسئله اینجاست که روشهای فعلی RL اغلب به دلیل محافظهکاری بیش از حد، دچار محدودیت در اکتشاف و پدیده «هک پاداش» میشوند.
این پژوهش با معرفی دو نوآوری کلیدی، این چالش را هدف قرار داده است:
1️⃣ Reward as an Agent: یک چارچوب عاملی که با ارزیابی فعال رفتارها، سیگنالهای پاداش قابلاعتمادتری تولید میکند.
2️⃣ DynDiff-GRPO: روشی برای تنوعبخشی به مسیرهای حرکت ربات که باعث میشود عامل (Agent) در محیطهای پیچیده، رفتارهای اکتشافی غنیتر و واقعیتری از خود نشان دهد.
این پیشرفت میتواند مسیر را برای ساخت رباتهای باهوشتر که در محیطهای فیزیکی واقعی بهتر عمل میکنند، هموارتر کند.
منبع: arXiv AI
