مدلهای زبانی-شنیداری (LALMs) با وجود هوش بالا، اغلب در تشخیص دقیق «زمان دقیق وقوع» یک صدا دچار مشکل هستند. حالا محققان راهکار جدیدی به نام Auto-AEG معرفی کردهاند.
این مدل با استفاده از یک خط لوله (Pipeline) خودکار برای تولید داده و یادگیری تقویتی، مشکل کمبود دادههای آموزشی برای «مکانیابی رویدادهای صوتی» را حل میکند. به زبان ساده، این فناوری به هوش مصنوعی کمک میکند تا دقیقاً بفهمد هر صدا در چه بازه زمانی در یک فایل صوتی رخ داده است؛ قابلیتی حیاتی که میتواند دقت دستیاران صوتی و سیستمهای تحلیل صدا را به سطح جدیدی برساند. 🚀
منبع: arXiv AI
