محققان در یک پیشرفت جدید، چارچوب VTM-Nav را برای رباتهای «عامل» (Embodied Agents) معرفی کردهاند که به آنها اجازه میدهد محیطهای داخلی را بهتر درک کنند. این مدل با ایجاد یک «حافظه بصری-توپولوژیک»، برخلاف مدلهای قبلی که با هر بار ریست کردن حافظهشان پاک میشد، میتواند تجربیات قبلی خود را در محیطهای تکراری حفظ و از آنها برای پیدا کردن اشیا استفاده کند.
این یعنی رباتها حالا با هوشمندی بیشتر و خطای کمتر در محیطهای پیچیده حرکت میکنند. این تکنیک بدون نیاز به آموزش اضافه (Training-free) و با کمک مدلهای بینایی-زبانی (VLM) پیادهسازی شده است.
منبع: arXiv Computer Vision
