اگر با مدلهای زبان بزرگ کار کردهاید، حتما میدانید که اجرای مدلهای طولانی (Long-Context) روی CPU چقدر سنگین و کُند است. حالا خبر خوب اینکه مدل جدید LFM2.5 با تکنیکهای بهینهسازی Encoder، این کار را بسیار سریعتر کرده است.
این یعنی نیاز به کارت گرافیکهای گرانقیمت برای استنتاج (Inference) کاهش پیدا کرده و توسعهدهندگان میتوانند مدلهای هوشمند را روی سیستمهای معمولی با سرعت بالا اجرا کنند. گام مهمی در جهت دموکراتیزه کردن هوش مصنوعی!
منبع: Hugging Face Blog
