آیا تا به حال به فکر کاهش هزینههای سنگین پردازشی مدلهای هوش مصنوعی بودهاید؟ فریمورک جدید «ARCQuant» با هدف حل مشکل کوانتایزیشن (Quantization) در قالبهای عددی جدید مثل NVFP4 معرفی شده است.
در این روش خلاقانه، محققان با استفاده از «کانالهای باقیمانده افزوده»، دقت مدلهای بزرگ (مانند LLaMA و Qwen) را حفظ کردهاند. نتیجه؟ عملکردی نزدیک به حالت Full-precision اما با بهینگی بسیار بالاتر در پردازندههای گرافیکی مثل RTX 5090!
این یعنی در آینده نزدیک میتوانیم مدلهای بسیار قدرتمندتر را روی سختافزارهای معمولیتر با سرعت و دقت خیرهکننده اجرا کنیم.
منبع: arXiv AI
