محققان در مطالعهای جدید، توانایی مدلهای بزرگ زبانی چندوجهی (MLLM) را در درک «تصاویر علمی» (SciVis) به چالش کشیدهاند. این تحقیق نشان میدهد که با وجود پیشرفتهای زیاد، مدلهای فعلی هنوز در تحلیلهای دقیق علمی، بهویژه در زمینههایی مثل تخمینهای کمی و تحلیل بافتها، ضعفهایی دارند.
نتیجه جالب اینجاست که در حالی که مدلهای بسته (مثل Gemini) توانستهاند در این تستها از میانگین عملکرد انسان پیشی بگیرند، مدلهای متنباز هنوز راه درازی در پیش دارند. این بررسی، استاندارد جدیدی برای ارزیابی هوش مصنوعی در محیطهای تخصصی و علمی تعریف میکند.
اگر به جزئیات فنی علاقهمندید، کد و خروجیهای این ارزیابی در گیتهاب پروژه در دسترس است. 🧠💻
های_چندوجهی
منبع: arXiv NLP
