📊 سنجش سواد علمی مدل‌های هوش مصنوعی در تحلیل نمودارها!

⚠️ هشدار به محققان: چرا دقت مدل‌های شناسایی پهپاد گاهی «واقعی» نیست؟

محققان در مطالعه‌ای جدید، توانایی مدل‌های بزرگ زبانی چندوجهی (MLLM) را در درک «تصاویر علمی» (SciVis) به چالش کشیده‌اند. این تحقیق نشان می‌دهد که با وجود پیشرفت‌های زیاد، مدل‌های فعلی هنوز در تحلیل‌های دقیق علمی، به‌ویژه در زمینه‌هایی مثل تخمین‌های کمی و تحلیل بافت‌ها، ضعف‌هایی دارند.

نتیجه جالب اینجاست که در حالی که مدل‌های بسته (مثل Gemini) توانسته‌اند در این تست‌ها از میانگین عملکرد انسان پیشی بگیرند، مدل‌های متن‌باز هنوز راه درازی در پیش دارند. این بررسی، استاندارد جدیدی برای ارزیابی هوش مصنوعی در محیط‌های تخصصی و علمی تعریف می‌کند.

اگر به جزئیات فنی علاقه‌مندید، کد و خروجی‌های این ارزیابی در گیت‌هاب پروژه در دسترس است. 🧠💻

‌های_چندوجهی

منبع: arXiv NLP