مدلهای زبانی چندوجهی (MLLM) همیشه در پردازش ویدیوهای طولانی با محدودیت حافظه روبرو بودند، اما حالا تکنیک جدیدی به نام LENS این چالش را تغییر داده است! 🎥
این فریمورک هوشمند که به صورت Training-free عمل میکند، به جای پردازش تمام ویدیو، تصمیم میگیرد که کجا برای جزئیات دقیق «زوماین» کند و کجا برای درک کلیت صحنه «زوماوت» انجام دهد. این روش باعث شده دقت مدلهایی مثل Qwen2.5-VL در تحلیل ویدیوهای طولانی به شکل چشمگیری افزایش یابد.
اگر در حوزه پردازش تصویر و ویدیو فعال هستید، حتما کد این پروژه را بررسی کنید!
🔗 لینک پروژه: https://github.com/zhangce01/LENS
منبع: arXiv Computer Vision
