🤖 تغییر پارادایم در ایمنی هوش مصنوعی: فراتر از عدم‌قطعیت مدل

⚠️ هشدار به محققان: چرا دقت مدل‌های شناسایی پهپاد گاهی «واقعی» نیست؟

محققان در یک پژوهش جدید، رویکرد متفاوتی را برای ایمن‌سازی سیستم‌های هوشمند پیشنهاد داده‌اند که به جای تکیه بر «عدم‌قطعیت مدل» (Model Uncertainty)، بر «بازخورد واقعی جهان» (World Feedback) تمرکز دارد. 🌍

در یادگیری تقویتی (RL)، معمولاً از ابزارهای داخلی مدل برای پیش‌بینی ریسک استفاده می‌شود که طبق این مطالعه، همیشه قابل اعتماد نیستند و گاهی حتی با ناامنی همبستگی مثبت دارند! این تیم با معرفی اصول «RLxF»، نشان دادند که استفاده از سیگنال‌های مستقیم از محیط (مانند حسگرهای لیزری و زمان تا برخورد) می‌تواند میزان خطاهای سیستم را به شکل چشمگیری کاهش دهد. این یافته نه تنها برای کنترل رباتیک، بلکه برای آینده مدل‌های زبانی در مسیر همسوسازی (Alignment) بسیار حیاتی است. 🚀

منبع: arXiv AI