محققان در پژوهش جدیدی، فریمورک نوآورانهای به نام «SOL-Nav» را معرفی کردهاند که دنیای مسیریابی رباتها (Vision-Language Navigation) را متحول میکند.
این مدل بهجای استفاده از پردازشهای سنگین تصویری، ورودیهای بصری (مانند تصاویر RGB-D) را به توصیفات ساختاریافته متنی تبدیل میکند. با این روش، رباتها با استفاده از مدلهای زبانی از پیش آموزشدیده (PLM)، بسیار کارآمدتر از گذشته در محیطهای ناشناخته حرکت میکنند و وابستگی به دادههای آموزشی حجیم نیز به شدت کاهش مییابد.
این یعنی در آینده، رباتهای امدادگر یا خانگی با هوش و دقت بسیار بیشتری محیط اطراف خود را درک کرده و مسیر درست را پیدا خواهند کرد. 🚀
منبع: arXiv Computer Vision
