مدلهای بزرگ بینایی-زبانی (LVLMs) با اینکه در نگاه اول باهوش به نظر میرسند، اما در استدلالهای پیچیده بصری اغلب دچار اشتباهات منطقی میشوند. حالا محققان برای حل این مشکل، بنچمارک جدیدی به نام «ConVBench» را معرفی کردهاند که منطق و ثباتِ پاسخدهی مدلها را به چالش میکشد.
علاوه بر این بنچمارک، مدل جدیدی به نام «ConVLM» نیز ارائه شده که با استفاده از یادگیری تقویتی (RL)، به مدل یاد میدهد که در پاسخ به پرسشهای معادل، منطقِ ثابتی داشته باشد. این یعنی حرکت به سمت هوش مصنوعی که نه تنها دقیقتر میبیند، بلکه منطقیتر هم استدلال میکند! 🧠✨
منبع: arXiv Computer Vision
