🧠 آیا مدل‌های هوش مصنوعی واقعاً می‌بینند؟ معرفی ZeroBench برای سنجش قدرت استدلال بصری

⚠️ هشدار به محققان: چرا دقت مدل‌های شناسایی پهپاد گاهی «واقعی» نیست؟

مدل‌های چندوجهی (LMM) هرچند در بنچ‌مارک‌های فعلی امتیازهای بالایی می‌گیرند، اما در مواجهه با مفاهیم ساده بصری گاهی ضعیف‌تر از کودکان یا حتی حیوانات عمل می‌کنند! 🧐

محققان برای حل این چالش، بنچ‌مارک جدید و بسیار دشواری به نام ZeroBench را معرفی کرده‌اند. این بنچ‌مارک با فیلترهای سخت‌گیرانه طراحی شده تا برای مدل‌های فعلی «غیرممکن» باشد. جالب اینجاست که حتی بهترین مدل‌های دنیا در زمان عرضه، امتیاز ۰ را کسب کردند و اکنون پس از یک سال، شاهد پیشرفت‌های بسیار جزئی (حدود ۱۹٪) در آن هستیم.

این یعنی ZeroBench استانداردی جدید برای سنجش قدرت واقعی درک محیط توسط هوش مصنوعی است. 🚀

🔗 برای بررسی جزئیات این بنچ‌مارک چالش‌برانگیز می‌توانید به وب‌سایت ZeroBench سر بزنید.

منبع: arXiv Computer Vision