محققان در یک پژوهش جدید، رویکرد متفاوتی را برای ایمنسازی سیستمهای هوشمند پیشنهاد دادهاند که به جای تکیه بر «عدمقطعیت مدل» (Model Uncertainty)، بر «بازخورد واقعی جهان» (World Feedback) تمرکز دارد. 🌍
در یادگیری تقویتی (RL)، معمولاً از ابزارهای داخلی مدل برای پیشبینی ریسک استفاده میشود که طبق این مطالعه، همیشه قابل اعتماد نیستند و گاهی حتی با ناامنی همبستگی مثبت دارند! این تیم با معرفی اصول «RLxF»، نشان دادند که استفاده از سیگنالهای مستقیم از محیط (مانند حسگرهای لیزری و زمان تا برخورد) میتواند میزان خطاهای سیستم را به شکل چشمگیری کاهش دهد. این یافته نه تنها برای کنترل رباتیک، بلکه برای آینده مدلهای زبانی در مسیر همسوسازی (Alignment) بسیار حیاتی است. 🚀
منبع: arXiv AI
