بسیاری از مدلهای زبانی چندوجهی (MLLM) برای کاهش «توهمات بصری» از روشی به نام «رمزگشایی تقابلی» (Contrastive Decoding) استفاده میکنند. اما پژوهش جدیدی که بهتازگی منتشر شده، نتایج عجیبی را نشان میدهد!
محققان در این مطالعه اثبات کردهاند که بهبودهای گزارششده در این مدلها چندان واقعی نیست و این روش در واقع عملکرد مدل را در تشخیص درست اشیاء ارتقا نمیدهد. این یعنی بسیاری از نتایج درخشان بنچمارکها صرفاً یک «سراب» هستند و لزوم بازنگری در روشهای فعلی برای افزایش دقت بصری مدلهای هوشمند بیش از پیش حس میشود. 📉🤔
این تحقیق نشان میدهد که دنیای تحقیقات هوش مصنوعی چقدر به نقد و بازتولید دقیق نتایج نیاز دارد تا از صحت پیشرفتها مطمئن شویم.
منبع: arXiv Machine Learning
