محققان در پژوهشی جدید، مدل نوآورانه «Q-GeoMem» را معرفی کردهاند که تحولی در استدلال فضایی ویدیوها ایجاد میکند. این مدل با استفاده از یک حافظه «پرسشمحور»، به جای ذخیرهسازی کورکورانه تمام اطلاعات، فقط دادههای هندسی و بصری مرتبط با سوال کاربر را تحلیل میکند.
این قابلیت باعث میشود مدل در درک محیطهای پیچیده ویدئویی بسیار دقیقتر عمل کرده و اطلاعات اضافی را فیلتر کند. این دستاورد گامی مهم برای دستیارهای هوشمند بصری و رباتهایی است که باید محیط اطراف خود را مانند انسان درک کنند. 🤖🎥
منبع: arXiv Computer Vision
