آیا تا به حال به هزینه سنگین محاسباتی برای مدلهای زبانی با طول متن (Context) بسیار بالا فکر کردهاید؟ محققان با معرفی تکنیک «Windowed-MTP»، مشکل بزرگ «پیشبینی چند توکنی» (MTP) در مدلهای میلیونی را حل کردهاند! 🧠
💡 نکته کلیدی:
این روش با اعمال یک پنجره لغزان هوشمند بر روی توجه (Attention) بخش تولید پیشنویس، نیاز به محاسبه کامل کل حافظه KV را از بین میبرد. نتیجه؟ کاهش ۴۴ درصدی هزینههای محاسباتی در طول متنهای بسیار طولانی، بدون افت دقت و بدون نیاز به آموزش مجدد!
این نوآوری به مدلهایی مثل Qwen و Mamba کمک میکند تا در سناریوهای سنگین، بسیار سریعتر و بهینهتر عمل کنند. سرعت بالاتر، هزینه کمتر! ⚡️
سازی
منبع: arXiv Machine Learning
