مدلهای چندوجهی (MLLMs) امروزه در تشخیص اشیاء عالی عمل میکنند، اما آیا قوانین فیزیک و مفاهیم اجتماعی دنیای واقعی را هم میفهمند؟ محققان با معرفی بنچمارک جدیدی به نام VKnowU به سراغ پاسخ این سوال رفتهاند.
این تحقیق با بررسی ۲۸ مدل هوش مصنوعی پیشرفته نشان داد که مدلها هنوز در درک مفاهیم انسانی و فیزیکی شکافهای بزرگی دارند. در همین راستا، مدل جدیدی به نام «VideoKnow+» نیز معرفی شده که با استفاده از تکنیک یادگیری تقویتی، درک بصری مدلها را به شکل قابلتوجهی ارتقا داده است. این یعنی قدمی دیگر به سوی هوش مصنوعی که نه تنها میبیند، بلکه دنیا را تحلیل میکند! 🚀✨
منبع: arXiv Computer Vision
