آیا تا به حال فکر کردهاید که مدلهای چندرسانهای (Multimodal) چگونه اطلاعات را پردازش میکنند؟ محققان در مطالعه جدید خود متوجه یک سوگیری عجیب شدهاند: برخلاف تصورات قبلی که فکر میکردیم هوش مصنوعی بخشهای میانی متن را فراموش میکند، در سیستمهای پرسشوپاسخ بصری (KB-VQA)، مدلها دچار «سوگیری اولویت» (Primacy Bias) میشوند.
در واقع این مدلها به شدت روی اطلاعات ابتدایی تمرکز کرده و بخشهای انتهایی را نادیده میگیرند. این یافته جدید نشان میدهد که معیارهای فعلی ارزیابی (مثل recall@k) دیگر برای مدلهای پیشرفته کافی نیستند و باید به دنبال راهکارهای ساختاری دقیقتری برای بهبود حافظه و دقت مدلهای هوش مصنوعی باشیم. دنیای پردازش تصویر و متن همچنان پیچیدهتر از آن است که فکر میکردیم! 🧠🤖
منبع: arXiv AI
