یک تحقیق جدید نشان داده که وقتی از مدلهای چندوجهی (MLLM) میخواهیم فراتر از پیشبینی ساده، «توضیح» بدهند که چرا یک تصویر را به این شکل طبقهبندی کردهاند، عملکردشان کمی افت میکند! 📉
خلاصه یافتههای این پژوهش:
🔹 وادار کردن مدل به ارائه توضیحات ساختاریافته و منطقی، دقت پیشبینی را از ۹۳.۸٪ به ۹۰.۱٪ کاهش میدهد.
🔹 توضیح دادن برای مدلهای فعلی سختتر از صرفاً پیشبینی کردن است.
🔹 اگر مدل بتواند ویژگیهای بصری متمایز را بهدرستی توصیف کند، توضیحش با دقت پیشبینی رابطه مستقیم دارد.
این یعنی با وجود قدرت فوقالعاده مدلها، ما هنوز با «استدلال شفاف و قابل تایید» در دنیای هوش مصنوعی فاصله داریم.
منبع: arXiv AI
