مدلهای بزرگ زبانی در حوزه ویدیو (VLLM) با وجود توانمندی بالا، با یک چالش بزرگ روبرو هستند: دادههای اضافی و طولانی ویدیوها که پردازش را کند میکند.
محققان در مقاله جدیدی، روشی نوآورانه به نام «PCA» (Persistence-Aware Compression and Aggregation) را معرفی کردهاند. این متد بدون نیاز به آموزش مجدد، با حذف هوشمند فریمهای تکراری و غنیسازی اطلاعات زمانی، سرعت پردازش ویدیو را ۱.۸ تا ۲.۵ برابر افزایش میدهد! این یعنی دقت بالاتر، مصرف منابع کمتر و استدلال سریعتر برای مدلهای ویدیویی.
کد این پژوهش هم برای علاقمندان در گیتهاب منتشر شده است.
منبع: arXiv Computer Vision
