🚀 جهشی جدید در درک ویدیوهای طولانی با LENS

🧠 چرا هوش مصنوعی گاهی «خیالات» می‌بیند؟

مدل‌های زبانی چندوجهی (MLLM) همیشه در پردازش ویدیوهای طولانی با محدودیت حافظه روبرو بودند، اما حالا تکنیک جدیدی به نام LENS این چالش را تغییر داده است! 🎥

این فریم‌ورک هوشمند که به صورت Training-free عمل می‌کند، به جای پردازش تمام ویدیو، تصمیم می‌گیرد که کجا برای جزئیات دقیق «زوم‌این» کند و کجا برای درک کلیت صحنه «زوم‌اوت» انجام دهد. این روش باعث شده دقت مدل‌هایی مثل Qwen2.5-VL در تحلیل ویدیوهای طولانی به شکل چشمگیری افزایش یابد.

اگر در حوزه پردازش تصویر و ویدیو فعال هستید، حتما کد این پروژه را بررسی کنید!

🔗 لینک پروژه: https://github.com/zhangce01/LENS

منبع: arXiv Computer Vision