یکی از بزرگترین چالشهای مدلهای بینایی-زبانی بزرگ (VLM)، هزینهی بالای پردازش و حجم عظیم دادههای تصویری است. اغلب روشهای موجود برای فشردهسازی و حذف توکنهای زائد، دچار تناقض میشوند؛ یعنی یا دقت مدل را کاهش میدهند یا بخشهای مهم تصویر را نادیده میگیرند.
تکنیک جدید «AnchorPrune» این مشکل را حل کرده است! این روش بدون نیاز به آموزش مجدد یا تغییر در معماری مدل، ابتدا یک «لنگر» از اطلاعات حیاتی تصویر ایجاد کرده و سپس با استفاده از یک فیلتر هوشمند، جزئیات تکمیلی را اضافه میکند. نتیجه؟ تعادل عالی بین دقت و سرعت، حتی در مدلهای قدرتمندی مثل LLaVA-NeXT.
این نوآوری راه را برای اجرای سریعتر مدلهای بینایی روی دستگاههای با منابع محدود هموارتر میکند. نظر شما چیست؟ آیا آینده در مدلهای سبکتر است یا مدلهای غولآسا؟
منبع: arXiv AI
