محققان در یک پژوهش جدید، به کالبدشکافی دقیق «خطاهای منطقی» در مدلهای بینایی-زبانی پرداختهاند. این مطالعه نشان میدهد که چرا این مدلها با وجود قدرت بالا، گاهی در استدلالهای ترکیبی (مانند تشخیص روابط فضایی یا جزئیات تصاویر) دچار اشتباه میشوند.
تیم پژوهشی با معرفی یک چارچوب جدید، متوجه شدند که خطاهای این مدلها به چهار دسته اصلی تقسیم میشوند: خطای زمینهسازی، خطای استدلال، خطای استخراج ویژگی و غلبه پیشفرضهای زبانی. این کشفِ مسیرهای داخلیِ خطا، قدم بزرگی برای توسعه مدلهای هوشمندتر و قابلاعتمادتر در آینده است! 🤖💡
منبع: arXiv Computer Vision
