🔍 آیا هوش مصنوعی واقعاً بهتر می‌بیند؟ چالش توهم در MLLMها

🧠 چرا هوش مصنوعی گاهی «خیالات» می‌بیند؟

بسیاری از مدل‌های زبانی چندوجهی (MLLM) برای کاهش «توهمات بصری» از روشی به نام «رمزگشایی تقابلی» (Contrastive Decoding) استفاده می‌کنند. اما پژوهش جدیدی که به‌تازگی منتشر شده، نتایج عجیبی را نشان می‌دهد!

محققان در این مطالعه اثبات کرده‌اند که بهبودهای گزارش‌شده در این مدل‌ها چندان واقعی نیست و این روش در واقع عملکرد مدل را در تشخیص درست اشیاء ارتقا نمی‌دهد. این یعنی بسیاری از نتایج درخشان بنچمارک‌ها صرفاً یک «سراب» هستند و لزوم بازنگری در روش‌های فعلی برای افزایش دقت بصری مدل‌های هوشمند بیش از پیش حس می‌شود. 📉🤔

این تحقیق نشان می‌دهد که دنیای تحقیقات هوش مصنوعی چقدر به نقد و بازتولید دقیق نتایج نیاز دارد تا از صحت پیشرفت‌ها مطمئن شویم.

منبع: arXiv Machine Learning