تا به حال فکر کردید مدلهای هوش مصنوعی چطور ویدیوهای بسیار طولانی را تحلیل میکنند؟ یکی از چالشهای اصلی، مدیریت حافظه (KV Cache) است که باعث میشود مدلها در درک ترتیب وقایع یا تغییرات زمانی دچار سردرگمی شوند.
محققان در مقالهای جدید، متد «ChronoStitch» را معرفی کردند. این روش بدون نیاز به آموزش مجدد (Training-Free)، به مدلها اجازه میدهد حافظههای بصری را بهطور دقیق ترکیب کنند. با این کار، مدل نه تنها متوجه میشود «چه چیزی» در ویدیو است، بلکه دقیقاً میداند «چه زمانی» اتفاق افتاده است! این دستاورد گامی مهم برای بهبود پاسخگویی هوش مصنوعی به سوالات مربوط به ویدیوهای بلند است.
منبع: arXiv Computer Vision
