اگر در حوزه بینایی ماشین و مدلهای سهبعدی فعالیت میکنید، حتماً با چالش درک دستورات متنی در فضای سهبعدی آشنا هستید. محققان به تازگی مدل «LISA-3D» را معرفی کردهاند که میتواند مدلهای بخشبندی (Segmentation) را به دنیای سهبعدی بیاورد.
ویژگیهای کلیدی این دستاورد:
🔹 استفاده از هوش مصنوعی برای درک دستورات متنی و تبدیل آنها به مدلهای سهبعدی دقیق.
🔹 حفظ سازگاری بین نماهای مختلف بدون نیاز به حاشیهنویسیهای پیچیده سهبعدی.
🔹 بازدهی بالا با تغییر تنها ۱۱.۶ میلیون پارامتر در لایههای LoRA.
این مدل یک گام بزرگ برای تبدیل زبان به دنیای واقعیت مجازی و بازسازی اشیاء محسوب میشود! ✨
منبع: arXiv Computer Vision
