مدلهای Vision Transformer (ViT) به دلیل دقت بالا بسیار محبوب هستند، اما هزینه محاسباتی زیاد آنها همیشه یک چالش بزرگ بوده است. حالا محققان با معرفی روش جدید «DopQ-ViT» راهکار جالبی برای فشردهسازی و کوانتیزاسیون (Quantization) این مدلها ارائه دادهاند.
این روش با تمرکز بر دو تکنیک نوآورانه:
✅ استفاده از Tan Quantizer برای حفظ توزیع توان در فعالسازیها
✅ بهرهگیری از MOSF برای انتخاب هوشمندانه ضرایب مقیاس بدون محاسبات اضافه
توانسته عملکرد مدلهای ViT را در تنظیمات کمدقت (Low-bit) به طرز چشمگیری بهبود ببخشد.
این یعنی سرعت بیشتر در پردازش تصاویر و کاهش حجم مدلها بدون افت کیفیت در وظایف طبقهبندی و تشخیص!
منبع: arXiv Computer Vision
