محققان در مطالعه جدید خود به سراغ بررسی مدلهای «بینایی-زبان-عمل» (VLA) رفتهاند تا ببینند این مدلها چطور تاریخچه تصاویر دریافتی را پردازش و از آن استفاده میکنند.
نتایج این تحقیق نشان میدهد که اگرچه مدلهای فعلی اطلاعات گذشته را در خود نگه میدارند، اما در بسیاری از موارد این دادهها فقط کپیِ غیرضروری از وضعیت فعلی هستند. نکته جالب اینجاست که این مدلها تنها زمانی به سراغ «حافظه» خود میروند که تصویر فعلی دچار مشکل یا نقص باشد.
این تحقیق گامی مهم برای درک بهتر استراتژیهای تصمیمگیری در روباتهای آینده و بهینهسازی مدلهای بصری است.
منبع: arXiv Computer Vision
