مدلهای زبانی چندوجهی (MLLM) علیرغم توانمندیهای خیرهکننده، در درک فضای سهبعدی ضعف دارند. پژوهشگران با معرفی روش جدید «GAP-MLLM»، پارادایم پیشآموزش جدیدی را ابداع کردهاند که به مدلها کمک میکند پیش از مواجهه با وظایف پیچیده، «آگاهی هندسی» پیدا کنند.
در این روش، مدل با پیشبینی نقشههای نقطهای (Pointmaps) در کنار برچسبهای متنی، ساختار سهبعدی محیط را بسیار دقیقتر درک میکند. این دستاورد میتواند تحولی در درک بصری رباتها و سیستمهای ناوبری هوشمند ایجاد کند. 🤖✨
منبع: arXiv Computer Vision
