تا به حال فکر کردهاید که ماشینهای خودران چطور محیطهای پیچیده را درک میکنند؟ مدلهای زبانی فعلی بیشتر روی تصاویر دوبعدی تمرکز دارند، اما محققان در مقاله جدیدی، مدل «D3VL» را معرفی کردهاند که میتواند دادههای سهبعدیِ حسگرهای LiDAR را با ویدیوها ترکیب کند!
💡 چرا این خبر مهم است؟
مدل D3VL با ادغام هوشمند دادههای دوبعدی و سهبعدی، درک صحنههای ترافیکی و ایمنی رانندگی را بهبود داده و در تستهای استاندارد، رشد عملکرد ۱۱ درصدی را ثبت کرده است. این یعنی گامی بزرگ به سوی خودروهایی که محیط اطرافشان را دقیقتر از همیشه «میبینند».
🌐 برای جزئیات بیشتر و بررسی مجموعه داده جدید WaymoQA، میتوانید به وبسایت پروژه سر بزنید.
منبع: arXiv AI
