تا به حال مدلهای بینایی-زبانی (VLM) در درک فضای سهبعدی و استدلالهای دقیق فضایی مشکل داشتند. حالا محققان با معرفی مدل VLM-IE3D این گره را باز کردهاند! 💡
این مدل با ترکیب دو تکنولوژی جدید:
✅ توکنهای هندسی ضمنی (IGT) برای درک کلیات فضایی
✅ توکنهای هندسی صریح (EGT) برای تحلیل جزئیات دقیق سهبعدی
توانسته بدون نیاز به دادههای سهبعدی پیچیده و تنها با پردازش ویدیوهای معمولی، درک سهبعدی فوقالعادهای از محیط پیدا کند. این یعنی جهشی بزرگ در تشخیص ویدیو، کپشننویسی دقیق سهبعدی و استدلالهای فضایی که کاربردهای بسیاری در رباتیک و واقعیت افزوده خواهد داشت. 🌍
لینک پروژه:
https://github.com/Vegetebird/VLM-IE3D
منبع: arXiv AI
