مدلهای زبانی چندوجهی به دلیل حجم عظیم پارامترها، سنگین و پرهزینه هستند. حالا محققان متد جدیدی به نام «C-PTQ» معرفی کردهاند که با استفاده از «وزندهی فیشر» (Fisher-weighted)، کانالهای حساس مدل را در زمان کوانتیزاسیون (Quantization) شناسایی و حفظ میکند.
✅ این روش بدون نیاز به ماژولهای اضافی مثل LoRA، دقت مدل را به شدت بالا میبرد و باعث میشود مدلهایی مثل LLaVA و Qwen2.5VL با سرعت و کارایی بسیار بیشتری اجرا شوند. این یک گام بزرگ برای اجرای مدلهای هوشمند روی سختافزارهای محدودتر است! 💡
منبع: arXiv Computer Vision
