یک مطالعه جدید روی مدلهای بینایی-زبانی (VLM) مثل Qwen2-VL و SmolVLM نشان میدهد که این مدلها در تشخیص خطاهای خود دچار مشکل هستند! 🧐
نکته جالب اینجاست که وقتی این مدلها عکسهای بیکیفیت یا تار میبینند، همچنان با اعتمادبهنفس بالا پاسخ میدهند (اعتماد کلامی)، اما «احتمال درونی» (Internal Probability) آنها نشان میدهد که واقعاً گیج شدهاند. محققان متوجه شدند که اعتماد به نفسِ بیانشده توسط مدل (وقتی میگوید “من مطمئنم”) با دقت واقعی آن همخوانی ندارد.
این تحقیق نشان میدهد که برای ساخت سیستمهای هوش مصنوعی قابلاطمینانتر در آینده، نباید فقط به پاسخهای متنی مدل تکیه کرد و باید به تحلیل احتمالات درونی مدلها بیشتر اهمیت داد. 📉🤖
منبع: arXiv Computer Vision
