محققان در مقالهای جدید از یک متد نوآورانه به نام «APIVOT» رونمایی کردند که هدفش ارتقای توانایی رباتها در انجام وظایف پیچیده و طولانی است.
این مدل جدید با ترکیب هوشمندانه «تفکر زبانی» (برای درک مفاهیم) و «تفکر بصری» (برای تصور آینده و بررسی موانع فیزیکی)، به رباتها اجازه میدهد محیط را بهتر درک کرده و در فضاهای پیچیده، بدون برخورد با اشیاء، مسیر درست را پیدا کنند.
در آزمایشهای انجام شده روی محیطهای آشپزخانه، این روش توانسته عملکرد بسیار بهتری نسبت به مدلهای بینایی-زبانی (VLM) فعلی داشته باشد. این یک گام بزرگ برای خودکارسازی دقیقتر رباتهای خانگی و صنعتی محسوب میشود! 🤖✨
منبع: arXiv Computer Vision
