مدلهای بزرگ بینایی-زبانی (LVLMs) معمولاً به خاطر پردازش حجم سنگینی از توکنهای ویدیویی، بسیار کند هستند. اما محققان به تازگی از راهکار جدیدی به نام «WaveZip» رونمایی کردهاند که این مشکل را با استفاده از تبدیل موجک (Wavelet Transform) حل میکند! 🌊
این مدل هوشمند با تفکیک هوشمندانه فرکانسهای مکانی و زمانی، توکنهای اضافی را حذف کرده و فقط روی جزئیات مهم متمرکز میشود. نکته جذاب اینجاست که WaveZip بدون نیاز به آموزش اضافه (Task-specific training)، مستقیماً روی مدلهای موجود قابل اجراست و سرعت تحلیل ویدیوهای طولانی را به شدت افزایش میدهد. گامی بزرگ برای هوش مصنوعی که میخواهد مثل ما فیلمها را درک کند! 🤖✨
منبع: arXiv Computer Vision
