آیا تا به حال دقت کردهاید که در برخی مدلهای تبدیل گفتار به متن، زمانبندی (Timestamp) با طولانی شدن مکالمه دچار خطا میشود؟ محققان بهتازگی راهکار جدیدی به نام REDDIT معرفی کردهاند که این مشکل را بدون آسیب زدن به دانش قبلی مدل حل میکند!
این روش هوشمندانه با ویرایش هدفمند دادههای زمانی و استفاده از تکنیک بازپخش (Replay)، دقت مدلهایی مثل Whisper را در تشخیص فواصل صوتی از ۳۸٪ به ۹۵٪ رسانده است، آن هم تنها با بهروزرسانی ۱.۶٪ از پارامترهای مدل. یک گام بزرگ برای دقیقتر شدن دستیارهای صوتی و سرویسهای زیرنویس هوشمند! 🚀
منبع: arXiv AI
