حتماً میدانید که تحلیل ویدیوهای طولانی توسط مدلهای زبانی چندوجهی (MLLM) به دلیل محدودیت پردازش فریمها، همیشه یک چالش بزرگ بوده است. محققان به تازگی راهکار هوشمندانهای برای رفع این مشکل پیدا کردهاند.
این مطالعه نشان میدهد که با تغییر استراتژی آموزش و تمرکز بر «استخراج ویژگیهای بصری»، میتوان مدلهای کوچکتر (مثل 2B) را به شکلی آموزش داد که عملکردی بهمراتب بهتر از مدلهای غولپیکر (8B) در تحلیل ویدیوها داشته باشند. این یعنی بهینهسازی دقیقتر و کاهش هزینههای پردازشی برای پلتفرمهای ویدیویی! 🚀✨
منبع: arXiv Computer Vision
