مدلهای چندوجهی فعلی در درک زبان عالی هستند، اما وقتی صحبت از درک «جهان واقعی» و استدلال فضایی در طول زمان میشود، هنوز با چالشهای بزرگی روبهرو هستند. محققان برای رفع این مشکل، بنچمارک جدیدی به نام VSI-Super-Wild را معرفی کردهاند.
این بنچمارک با بررسی بیش از ۴ ساعت ویدیوی واقعی و ۶۹۸۰ سوال و جواب انسانی، نقاط ضعف مدلها در درکِ همزمانِ «ناظر»، «اشیاء» و «محیط» را آشکار کرده است. نتایج نشان میدهد که مدلها در دنبال کردن وضعیت جهان در طولانیمدت، همچنان دچار خطاهای جدی میشوند. این قدم بزرگی برای رسیدن به سیستمهای بینایی هوشمندتر و قابلاعتمادتر است! 🚀
منبع: arXiv Computer Vision
