📊 چالش شمارش در مدل‌های زبانی؛ بنچ‌مارک جدید HoloCount برای سنجش هوش چندوجهی!

⚠️ هشدار به محققان: چرا دقت مدل‌های شناسایی پهپاد گاهی «واقعی» نیست؟

آیا مدل‌های هوش مصنوعی (MLLMs) واقعاً قدرت شمارش و درک بصری دقیقی دارند؟ با اینکه این مدل‌ها در درک کلی صحنه‌ها عالی هستند، اما هنوز در شمارش دقیق اشیا به دلیل خطاهای منطقی و توهم‌های عددی دچار مشکل می‌شوند.

محققان به تازگی بنچ‌مارک جدیدی به نام HoloCount را معرفی کرده‌اند که به صورت تخصصی توانایی‌های عددی مدل‌های چندوجهی را در سه سطح ارزیابی می‌کند:
1️⃣ شمارش معنایی (اشیاء و ویژگی‌ها)
2️⃣ شمارش تحلیلی (استدلال‌های فضایی و منطقی)
3️⃣ تست مقاومت (در برابر سوگیری‌ها و تصاویر پیچیده)

نتایج این تحقیق نشان می‌دهد حتی پیشرفته‌ترین مدل‌های فعلی هم با پیچیده‌تر شدن سناریوها، دچار افت دقت می‌شوند. این بنچ‌مارک گام مهمی برای رسیدن به دقت بالاتر در مدل‌های آینده است. 🤖🧠

منبع: arXiv Computer Vision