اگر درگیر اجرای مدلهای هوش مصنوعی روی سختافزارهای محدود هستید، این خبر برای شماست! محققان به تازگی راهکاری ارائه دادهاند که با ترکیب «کوانتیزاسیون» (Quantization) و «دیکودینگ حدسی» (Speculative Decoding)، مدل قدرتمند Qwen3.5-4B را روی کارت گرافیک NVIDIA A10G تا حدود ۷ برابر سریعتر کرده است.
نکته جالب اینجاست که آنها با استفاده از تقطیر دانش (Distillation) و تنظیم دقیق مدلِ حدسزننده، توانستهاند بدون افت کیفیت، تاخیر در پاسخدهی را به شکل چشمگیری کاهش دهند. این دستاورد گام بزرگی برای اجرای مدلهای هوش مصنوعی بزرگ بر روی سیستمهای معمولی است. جزئیات بیشتر و کد پروژه را میتوانید در گیتهاب آنها بررسی کنید.
سازی
منبع: arXiv Machine Learning
