خبر خوب برای علاقهمندان به دنیای هوش مصنوعی و مدلهای چندوجهی! اخیراً روش جدیدی به نام «AnchorPrune» معرفی شده که به طور چشمگیری سرعت پردازش مدلهای بینایی-زبانی (VLM) را افزایش میدهد.
💡 چرا این موضوع مهم است؟
مدلهای بزرگ در پردازش تصاویر با وضوح بالا، توکنهای بصری بسیار زیادی تولید میکنند که باعث کندی و هزینهی بالای اجرا میشود. روش AnchorPrune بدون نیاز به آموزش مجدد (Training-free) و تغییر در معماری، به جای حذف کورکورانه توکنها، با شناسایی هوشمندانهی «لنگرهای مرتبط» و گسترش آن با بافت بصری مکمل، دقت و سرعت مدل را در فشردهسازیهای سنگین حفظ میکند.
این یعنی در آیندهای نزدیک میتوانیم انتظار داشته باشیم که مدلهای هوش مصنوعی با مصرف منابع کمتر، پاسخهای دقیقتر و سریعتری به تصاویر و ویدیوهای ما بدهند.
منبع: arXiv AI
