آیا تا به حال دقت کردهاید که گاهی اوقات در زیرنویسهای تولید شده توسط هوش مصنوعی (ASR)، زمانبندی متن با صدای اصلی هماهنگ نیست؟ محققان بهتازگی راهکار جدیدی به نام REDDIT ارائه دادهاند که بدون نیاز به برچسبگذاری انسانی، این «دریفت» یا فاصله زمانی را اصلاح میکند.
نکته جالب اینجاست که این روش با استفاده از یک تکنیک بازپخش هوشمند، از «فراموشی فاجعهبار» (Catastrophic Forgetting) جلوگیری میکند؛ یعنی مدل بدون اینکه دانش قبلی خود را از دست بدهد، دقت زمانبندی را بهطور خیرهکنندهای (از ۳۸٪ به ۹۵٪ در آزمایشها) افزایش میدهد. یک گام مهم برای دقت بیشتر در تبدیل صدا به متن! 🚀
منبع: arXiv AI
