محققان در مقالهای جدید، متد انقلابی LESV را معرفی کردهاند که تحولی در «درک صحنههای سهبعدی با واژگان باز» (Open-Vocabulary 3D Scene Understanding) ایجاد میکند. این مدل با عبور از محدودیتهای مدلهای قبلی که از 3DGS استفاده میکردند، از ساختار «واکسلهای پراکنده» بهره میبرد تا دقت هندسی و معنایی فوقالعادهای را ارائه دهد.
این یعنی درک بسیار دقیقتر و هوشمندتر رباتها و سیستمهای بینایی ماشین از محیطهای پیچیده اطرافمان بدون سردرگمیهای بصری رایج. گامی دیگر به سوی واقعیتر شدن تعامل دنیای فیزیکی با هوش مصنوعی! 🤖💡
منبع: arXiv Computer Vision
