🎥 خداحافظی با کندی در پردازش ویدیوهای طولانی!

🧠 چرا هوش مصنوعی گاهی «خیالات» می‌بیند؟

مدل‌های بزرگ بینایی-زبانی (LVLMs) معمولاً به خاطر پردازش حجم سنگینی از توکن‌های ویدیویی، بسیار کند هستند. اما محققان به تازگی از راهکار جدیدی به نام «WaveZip» رونمایی کرده‌اند که این مشکل را با استفاده از تبدیل موجک (Wavelet Transform) حل می‌کند! 🌊

این مدل هوشمند با تفکیک هوشمندانه فرکانس‌های مکانی و زمانی، توکن‌های اضافی را حذف کرده و فقط روی جزئیات مهم متمرکز می‌شود. نکته جذاب اینجاست که WaveZip بدون نیاز به آموزش اضافه (Task-specific training)، مستقیماً روی مدل‌های موجود قابل اجراست و سرعت تحلیل ویدیوهای طولانی را به شدت افزایش می‌دهد. گامی بزرگ برای هوش مصنوعی که می‌خواهد مثل ما فیلم‌ها را درک کند! 🤖✨

منبع: arXiv Computer Vision