🚀 ارتقای هوشِ بصری مدل‌های چندوجهی با بنچمارک جدید ConVBench

🧠 چرا هوش مصنوعی گاهی «خیالات» می‌بیند؟

مدل‌های بزرگ بینایی-زبانی (LVLMs) با اینکه در نگاه اول باهوش به نظر می‌رسند، اما در استدلال‌های پیچیده بصری اغلب دچار اشتباهات منطقی می‌شوند. حالا محققان برای حل این مشکل، بنچمارک جدیدی به نام «ConVBench» را معرفی کرده‌اند که منطق و ثباتِ پاسخ‌دهی مدل‌ها را به چالش می‌کشد.

علاوه بر این بنچمارک، مدل جدیدی به نام «ConVLM» نیز ارائه شده که با استفاده از یادگیری تقویتی (RL)، به مدل یاد می‌دهد که در پاسخ به پرسش‌های معادل، منطقِ ثابتی داشته باشد. این یعنی حرکت به سمت هوش مصنوعی که نه تنها دقیق‌تر می‌بیند، بلکه منطقی‌تر هم استدلال می‌کند! 🧠✨

منبع: arXiv Computer Vision