مدلهای زبانی دیفیوژن (DLLMs) به دلیل محاسبات سنگین و تکراری، اغلب کُند عمل میکنند. حالا محققان چارچوب نوآورانه «LaCache» را معرفی کردهاند که با استفاده از «کشینگ هوشمند» و «کوانتیزاسیون FP8»، محاسبات اضافی را حذف میکند.
نتایج فوقالعاده است: این روش بهتنهایی ۳۰٪ سرعت را افزایش میدهد و در ترکیب با سایر روشها، میتواند تا ۴۰ برابر سرعت مدل را بدون افت دقت بهبود ببخشد! 🤯
این یعنی نسل آینده مدلهای مولد، بسیار سریعتر و بهینهتر از امروز خواهند بود. 💡
سازی
منبع: arXiv AI
