محققان در دستاوردی تازه، تکنیک جدیدی به نام «SpecLA» را برای بهینهسازی مدلهای «Linear-Attention» معرفی کردهاند. همانطور که میدانید، یکی از چالشهای بزرگ در مدلهای زبانی، سرعت پایین تولید توکنها به صورت تکتک است.
این روش جدید با استفاده از «گمانهزنی در رمزگشایی» (Speculative Decoding) و متناسبسازی آن برای ساختار مدلهای توجه خطی، اجازه میدهد چندین توکن به صورت همزمان بررسی شوند. نتیجه؟ تا ۱.۷۰ برابر سرعت بیشتر در پردازش مدلهایی مثل GDN-1.3B روی سختافزار H100! ⚡️
این پیشرفت گام بزرگی برای کاهش هزینههای محاسباتی و افزایش بازدهی مدلهای AI در محیطهای عملیاتی است.
منبع: arXiv NLP
