محققان در پژوهش جدیدی با معرفی فریمورک «ViewSuite»، گام بزرگی در توانایی مدلهای بینایی-زبانی (VLM) برای درک و حرکت در محیطهای سهبعدی برداشتهاند.
مشکل اصلی مدلهای فعلی این است که شاید بدانند با یک حرکت ساده، دیدگاهشان چه تغییری میکند، اما در «برنامهریزی چندمرحلهای» برای رسیدن به یک هدف خاص در فضای سهبعدی ضعیف هستند. اما حالا با یک روش نوآورانه (استفاده از خودکاوی و گرافهای دیدگاه)، مدل Qwen2.5-VL-7B توانسته عملکرد خود را در این زمینه به شکل چشمگیری بهبود دهد و حتی از مدلهای بزرگتری مثل GPT-5.4 Pro و Gemini 3.1 Pro پیشی بگیرد.
این یعنی هوش مصنوعی به زودی میتواند در محیطهای واقعی، مثل یک انسان، فعالانه در فضا حرکت کند و برای دیدنِ هدفِ خود برنامهریزی دقیقی داشته باشد. 🤖✨
🔗 لینک پروژه: https://viewsuite.github.io
ریزی
منبع: arXiv AI
