مدلهای زبانی چندوجهی (MLLM) علیرغم هوش بالایی که دارند، معمولاً در درک ابعاد سهبعدی و فیزیک محیط دچار ضعف هستند. حالا پژوهشگران با معرفی فریمورک «VEGA-3D»، راهکار جذابی پیدا کردهاند.
این سیستم با استفاده از «دانش ضمنی» مدلهای تولید ویدیوی پیشفرض، به هوش مصنوعی کمک میکند تا بدون نیاز به دادههای سهبعدی پیچیده، درک عمیقتری از هندسه و قوانین فیزیکی دنیای واقعی داشته باشد. این یعنی گامی بلند برای رباتها و سیستمهایی که نیاز دارند محیط اطراف خود را مثل انسان درک کنند! 🤖🌐
📌 جزئیات بیشتر و کد پروژه در گیتهاب قابل دسترسی است.
منبع: arXiv Computer Vision
