🚀 هوش مصنوعی سه‌بعدی می‌بیند! معرفی مدل پیشرو VLM-IE3D 🧠

🧠 چرا هوش مصنوعی گاهی «خیالات» می‌بیند؟

تا به حال مدل‌های بینایی-زبانی (VLM) در درک فضای سه‌بعدی و استدلال‌های دقیق فضایی مشکل داشتند. حالا محققان با معرفی مدل VLM-IE3D این گره را باز کرده‌اند! 💡

این مدل با ترکیب دو تکنولوژی جدید:
✅ توکن‌های هندسی ضمنی (IGT) برای درک کلیات فضایی
✅ توکن‌های هندسی صریح (EGT) برای تحلیل جزئیات دقیق سه‌بعدی

توانسته بدون نیاز به داده‌های سه‌بعدی پیچیده و تنها با پردازش ویدیوهای معمولی، درک سه‌بعدی فوق‌العاده‌ای از محیط پیدا کند. این یعنی جهشی بزرگ در تشخیص ویدیو، کپشن‌نویسی دقیق سه‌بعدی و استدلال‌های فضایی که کاربردهای بسیاری در رباتیک و واقعیت افزوده خواهد داشت. 🌍

لینک پروژه:
https://github.com/Vegetebird/VLM-IE3D

منبع: arXiv AI