🎧 شنیدن دقیق‌تر هوش مصنوعی؛ معرفی Auto-AEG برای درک بهتر صدا

🧠 چرا هوش مصنوعی گاهی «خیالات» می‌بیند؟

مدل‌های بزرگ صوتی-زبانی (LALMs) خیلی خوب حرف می‌زنند، اما وقتی پای «زمان‌بندی دقیق» و تشخیص لحظه به لحظه وقایع صوتی وسط می‌آید، معمولاً دچار ضعف هستند.

محققان برای حل این مشکل، راهکار جدیدی به نام «Auto-AEG» را معرفی کرده‌اند. این سیستم با استفاده از داده‌های سنتز شده (شبیه‌سازی شده) و یادگیری تقویتی، به مدل‌های هوش مصنوعی یاد می‌دهد که دقیقاً بفهمند هر صدای خاص در چه بازه زمانی رخ داده است.

این پیشرفت نه تنها دقت شناسایی وقایع صوتی را بالا می‌برد، بلکه وابستگی مدل‌ها به داده‌های دستیِ گران‌قیمت را هم کاهش می‌دهد. حالا مدل‌ها می‌توانند با دقت بسیار بیشتری، وقایع را از دل فایل‌های صوتی بیرون بکشند! 🔊✨

منبع: arXiv AI