مدلهای بزرگ صوتی-زبانی (LALMs) خیلی خوب حرف میزنند، اما وقتی پای «زمانبندی دقیق» و تشخیص لحظه به لحظه وقایع صوتی وسط میآید، معمولاً دچار ضعف هستند.
محققان برای حل این مشکل، راهکار جدیدی به نام «Auto-AEG» را معرفی کردهاند. این سیستم با استفاده از دادههای سنتز شده (شبیهسازی شده) و یادگیری تقویتی، به مدلهای هوش مصنوعی یاد میدهد که دقیقاً بفهمند هر صدای خاص در چه بازه زمانی رخ داده است.
این پیشرفت نه تنها دقت شناسایی وقایع صوتی را بالا میبرد، بلکه وابستگی مدلها به دادههای دستیِ گرانقیمت را هم کاهش میدهد. حالا مدلها میتوانند با دقت بسیار بیشتری، وقایع را از دل فایلهای صوتی بیرون بکشند! 🔊✨
منبع: arXiv AI
