محققان در مقالهای جدید به سراغ چالش هزینههای بالای پردازشی در مدلهای بزرگ «تشخیص گفتار خودکار» (ASR) رفتهاند. این تیم با بررسی دقیق الگوریتمهای «تقطیر دانش» (Knowledge Distillation) و تمرکز بر نحوه مدیریت توکنهای Blank در CTC، روشی متقارن ارائه دادهاند که اجازه میدهد بدون افت کیفیت و بدون نیاز به برچسبهای متنی، مدلهای کوچکتر را با دقت مدلهای بزرگ آموزش دهیم.
این دستاورد یعنی مسیر برای استفاده از دادههای صوتیِ بدون متن (Untranscribed) باز شده و میتواند هزینههای آموزش مدلهای هوش مصنوعی را به شدت کاهش دهد. گامی مهم برای هوش مصنوعیِ بهینهتر و در دسترستر! 🎧🤖
منبع: arXiv Machine Learning


