یکی از بزرگترین چالشهای مدلهای زبانی چندوجهی (MLLM) با رزولوشن بالا، پردازش تعداد بسیار زیادی توکن بصری است که باعث کندی شدید میشود. محققان به تازگی معماری جدیدی به نام «SFPruner» معرفی کردهاند که به جای استفاده از روشهای پیچیده و کندِ تکرار شونده، با یک «گذر مستقیم» (Single-Forward Pass)، توکنهای زائد را شناسایی و حذف میکند.
این نوآوری باعث میشود بدون افت کیفیت، سرعت پردازش مدلهای هوش مصنوعی بهطور قابل توجهی افزایش یابد و استفاده از آنها در محیطهای عملیاتی بهینه شود. گامی بزرگ برای کاربردیتر کردن مدلهای هوشمند بصری! 🧠✨
منبع: arXiv Computer Vision
