محققان مدل جدیدی به نام video-SALMONN-R³ معرفی کردهاند که تحولی در درک ویدیو توسط هوش مصنوعی ایجاد میکند. این مدل با یک استراتژی هوشمندانه، ابتدا یک درک کلی از ویدیو پیدا میکند و سپس بخشهای مهم را دوباره «بازبینی» (Re-watch) میکند تا جزئیات را از دست ندهد.
از ویژگیهای جذاب این مدل:
✅ نیاز نداشتن به آموزشهای پرهزینه و پیچیده (Chain-of-Thought)
✅ قابلیت «بازبینی»، «بازپرسی» و «بازپاسخدهی» برای دقت بالاتر
✅ عملکرد بسیار بهتر در درک ویدیو با مصرف بهینه منابع محاسباتی
این مدل ثابت میکند که برای درک بهتر محتوا، لازم نیست همیشه هزینههای سنگین پردازشی پرداخت کرد، بلکه میتوان با استراتژی درست، هوشمندتر عمل کرد! 🚀
منبع: arXiv Computer Vision
