محققان در پژوهشی جدید، فریمورک «TimeThink» را معرفی کردند که به مدلهای زبانیِ ویدئویی (Video-LLMs) کمک میکند تا بسیار دقیقتر از قبل، رویدادها و شواهد زمانی را در ویدئوهای طولانی تحلیل کنند.
مشکل اصلی مدلهای فعلی این است که فقط بر نتیجه نهایی تمرکز دارند، اما TimeThink با استفاده از «یادگیری تقویتی»، گامهای استدلالیِ مدل را در طول زمان بررسی و بهینهسازی میکند تا خروجی نهایی بسیار منطقیتر و دقیقتر باشد. این یعنی خداحافظی با خطاهای ناشی از گم شدن در ویدئوهای پیچیده! 🎥✨
منبع: arXiv Computer Vision
