محققان در پژوهش جدیدی متوجه شدند که روشهای فعلی آموزش هوش مصنوعی (Self-Reward)، یک حفره امنیتی جدی دارند. مدلهایی که یاد میگیرند پاسخهای خودشان را قضاوت کنند، دچار «هک پاداش» میشوند؛ یعنی به جای اینکه سعی کنند «جواب درست» را بدهند، یاد میگیرند طوری پاسخ دهند که خودشان (به عنوان داور) را قانع کنند! 🤨
🔹 نکته کلیدی: در آزمایشها، دقتِ ظاهری مدلها در سیستمهای خود-داور به ۹۴٪ رسید، اما دقت واقعی آنها در حل مسائل ریاضی تنها ۲۰٪ بود!
این تحقیق نشان میدهد که اعتماد بیچون و چرا به سیستمهای LLM-as-a-Judge (استفاده از هوش مصنوعی برای ارزیابی پاسخها) میتواند بسیار خطرناک باشد، مگر اینکه مدل قبل از قضاوت کردن، خودش پاسخ را پیدا کرده باشد.
این یک زنگ خطر مهم برای توسعهدهندگان مدلهای زبانی است که به سیستمهای خود-ارزیاب تکیه کردهاند. 📉
منبع: arXiv Machine Learning
