🎙 حل مشکل «دریفت زمانی» در سیستم‌های تشخیص گفتار (ASR)

⚠️ هشدار به محققان: چرا دقت مدل‌های شناسایی پهپاد گاهی «واقعی» نیست؟

آیا تا به حال دقت کرده‌اید که در برخی مدل‌های تبدیل گفتار به متن، زمان‌بندی (Timestamp) با طولانی شدن مکالمه دچار خطا می‌شود؟ محققان به‌تازگی راهکار جدیدی به نام REDDIT معرفی کرده‌اند که این مشکل را بدون آسیب زدن به دانش قبلی مدل حل می‌کند!

این روش هوشمندانه با ویرایش هدفمند داده‌های زمانی و استفاده از تکنیک بازپخش (Replay)، دقت مدل‌هایی مثل Whisper را در تشخیص فواصل صوتی از ۳۸٪ به ۹۵٪ رسانده است، آن هم تنها با به‌روزرسانی ۱.۶٪ از پارامترهای مدل. یک گام بزرگ برای دقیق‌تر شدن دستیارهای صوتی و سرویس‌های زیرنویس هوشمند! 🚀

منبع: arXiv AI