مدلهای زبانی چندوجهی (MLLM) در درک متن عالی هستند، اما آیا در تحلیل نمودارهای پیچیده، فلوچارتها و حتی نقشههای دستنویس هم به همین اندازه موفقاند؟ محققان بهتازگی بنچمارک جامع ChartArena را معرفی کردهاند تا این توانایی را به چالش بکشند.
این بنچمارک با پوشش انواع نمودارها در سناریوهای مختلف (از تصاویر دیجیتال تا عکسهای دستنویس)، راه را برای ارزیابی دقیقتر مدلهای بینایی-زبانی باز کرده است. نکته جالب اینجاست که طبق ارزیابیها، در حالی که مدلهای تجاری قدرتمندی مثل Gemini 3.1 Pro پیشتاز هستند، مدلهای متنباز (Open-source) با سرعت خیرهکنندهای در حال کاهش این فاصله هستند. 🚀
این تحقیق نشان میدهد که درک نمودار و دیاگرام، همچنان یک میدان نبرد داغ برای مدلهای هوش مصنوعی است.
منبع: arXiv Computer Vision
