مدلهای چندوجهی (LMM) هرچند در بنچمارکهای فعلی امتیازهای بالایی میگیرند، اما در مواجهه با مفاهیم ساده بصری گاهی ضعیفتر از کودکان یا حتی حیوانات عمل میکنند! 🧐
محققان برای حل این چالش، بنچمارک جدید و بسیار دشواری به نام ZeroBench را معرفی کردهاند. این بنچمارک با فیلترهای سختگیرانه طراحی شده تا برای مدلهای فعلی «غیرممکن» باشد. جالب اینجاست که حتی بهترین مدلهای دنیا در زمان عرضه، امتیاز ۰ را کسب کردند و اکنون پس از یک سال، شاهد پیشرفتهای بسیار جزئی (حدود ۱۹٪) در آن هستیم.
این یعنی ZeroBench استانداردی جدید برای سنجش قدرت واقعی درک محیط توسط هوش مصنوعی است. 🚀
🔗 برای بررسی جزئیات این بنچمارک چالشبرانگیز میتوانید به وبسایت ZeroBench سر بزنید.
منبع: arXiv Computer Vision
