محققان تکنیک جدیدی به نام «PolyQ» معرفی کردهاند که انقلابی در اجرای مدلهای هوش مصنوعی بزرگ (LLM) روی پردازندههای معمولی (CPU) ایجاد میکند.
تا پیش از این، اجرای مدلهایی مثل Llama2 یا Qwen روی سیستمهای بدون GPU بسیار دشوار بود، اما PolyQ با بهینهسازی هوشمند و تخصیص دقیق بیتها، سرعت و کارایی مدلها را روی لپتاپ و موبایل بهطور چشمگیری افزایش داده است. این یعنی کاهش مصرف انرژی و افزایش سرعت پاسخدهی برای اجرای مدلهای هوشمند به صورت آفلاین و در دسترستر برای همه! ⚡
سازی افزار
منبع: arXiv Machine Learning
