محققان در یک پژوهش جدید، راهکاری نوآورانه برای «مکانیابی منابع صوتی» در ویدیوها ارائه کردهاند. چالش اصلی این است که معمولاً مدلهای هوش مصنوعی برای درک محتوای تصویری و صوتی بهصورت کلی آموزش میبینند و جزئیات مکانی را از دست میدهند.
در این مطالعه، تکنیکی به نام «LAIP» معرفی شده که با استفاده از لایههای میانی مدلهای بازیابی (Retrieval)، اطلاعات فضایی دقیق را بازیابی میکند. این مدل میتواند بدون نیاز به برچسبگذاری پیچیده پیکسلها، دقیقاً تشخیص دهد که هر صدا در ویدیو از کجا میآید! این دستاورد، دقت مدلهای صوتی-تصویری (AV) را در بنچمارکهای مهمی مثل AVATAR تا دو برابر افزایش داده است. 🚀
منبع: arXiv AI
