آیا مدلهای هوش مصنوعی (MLLMs) واقعاً قدرت شمارش و درک بصری دقیقی دارند؟ با اینکه این مدلها در درک کلی صحنهها عالی هستند، اما هنوز در شمارش دقیق اشیا به دلیل خطاهای منطقی و توهمهای عددی دچار مشکل میشوند.
محققان به تازگی بنچمارک جدیدی به نام HoloCount را معرفی کردهاند که به صورت تخصصی تواناییهای عددی مدلهای چندوجهی را در سه سطح ارزیابی میکند:
1️⃣ شمارش معنایی (اشیاء و ویژگیها)
2️⃣ شمارش تحلیلی (استدلالهای فضایی و منطقی)
3️⃣ تست مقاومت (در برابر سوگیریها و تصاویر پیچیده)
نتایج این تحقیق نشان میدهد حتی پیشرفتهترین مدلهای فعلی هم با پیچیدهتر شدن سناریوها، دچار افت دقت میشوند. این بنچمارک گام مهمی برای رسیدن به دقت بالاتر در مدلهای آینده است. 🤖🧠
منبع: arXiv Computer Vision
