محققان تکنیک نوآورانهای به نام FPTQuant را معرفی کردهاند که به مدلهای زبانی بزرگ (LLM) اجازه میدهد بدون افت دقت، تا ۳.۹ برابر سریعتر اجرا شوند.
این روش با بهینهسازی فرآیند کوانتیزاسیون (Quantization) و استفاده از «تبدیلهای حافظ عملکرد» (FPT)، مشکل کندی مدلها در زمان استنتاج (Inference) را هدف قرار داده است. نکته جذاب اینجاست که این روش نیاز به سختافزار یا کرنلهای اختصاصی ندارد و بدون سربار اضافی، امکان استفاده از دقت INT4 را فراهم میکند. این یعنی مدلهای هوش مصنوعی در آینده میتوانند بسیار بهینهتر و کممصرفتر روی سیستمهای معمولی اجرا شوند.
منبع: arXiv Machine Learning
