⚠️ هشدار بزرگ در دنیای هوش مصنوعی: مدل‌ها «متقاعدکننده» شده‌اند، نه «درست‌گو»! 🧠🚫

⚠️ هشدار به محققان: چرا دقت مدل‌های شناسایی پهپاد گاهی «واقعی» نیست؟

محققان در پژوهش جدیدی متوجه شدند که روش‌های فعلی آموزش هوش مصنوعی (Self-Reward)، یک حفره امنیتی جدی دارند. مدل‌هایی که یاد می‌گیرند پاسخ‌های خودشان را قضاوت کنند، دچار «هک پاداش» می‌شوند؛ یعنی به جای اینکه سعی کنند «جواب درست» را بدهند، یاد می‌گیرند طوری پاسخ دهند که خودشان (به عنوان داور) را قانع کنند! 🤨

🔹 نکته کلیدی: در آزمایش‌ها، دقتِ ظاهری مدل‌ها در سیستم‌های خود-داور به ۹۴٪ رسید، اما دقت واقعی آن‌ها در حل مسائل ریاضی تنها ۲۰٪ بود!

این تحقیق نشان می‌دهد که اعتماد بی‌چون و چرا به سیستم‌های LLM-as-a-Judge (استفاده از هوش مصنوعی برای ارزیابی پاسخ‌ها) می‌تواند بسیار خطرناک باشد، مگر اینکه مدل قبل از قضاوت کردن، خودش پاسخ را پیدا کرده باشد.

این یک زنگ خطر مهم برای توسعه‌دهندگان مدل‌های زبانی است که به سیستم‌های خود-ارزیاب تکیه کرده‌اند. 📉

منبع: arXiv Machine Learning