مدلهای صوتی معمولاً برای تعیین زمانبندی (مانند پیدا کردن لحظه دقیق یک کلمه)، آن را به متن تبدیل میکنند که هم کند است و هم مستعد خطا. اما محققان روشی جدید به نام «استفاده مجدد از بازنماییهای داخلی» (Internal Frame-level Reuse) ابداع کردهاند که در آن هوش مصنوعی مستقیماً از دادههای پردازششدهی خود استفاده میکند.
نتیجه؟ این روش نه تنها بیش از ۵۰ برابر سریعتر از مدلهای فعلی است، بلکه در بازههای زمانی طولانی هم دقت بسیار بالاتری دارد و از توهمات (Hallucinations) مدلهای معمولی جلوگیری میکند. این یعنی دستیارهای صوتی آینده بسیار سریعتر و هوشمندتر خواهند بود! 🎙️⚡️
منبع: arXiv Machine Learning
