محققان در مقالهای جدید، راهکار نوآورانهای برای «تولید کپشنهای متراکم ویدیو» (Dense Video Captioning) معرفی کردند. تا پیش از این، مدلهای زبانی بزرگ برای توصیف ویدیو، توکنها را به صورت ترتیبی پردازش میکردند که باعث کندی شدید در ویدیوهای طولانی میشد.
در این روش جدید با استفاده از «رمزگشایی اتورگرسیو موازی» (Parallelized Autoregressive Decoding)، مدل میتواند با درک وابستگیهای محلی بین رویدادها، بخشهای مختلف کپشن را همزمان تولید کند. این یعنی سرعت بسیار بالاتر در کنار دقت عالی در درک محتوای ویدیویی!
این پیشرفت میتواند به زودی باعث شود مدلهای هوش مصنوعی ویدیو را سریعتر و دقیقتر از همیشه تحلیل و توصیف کنند.
منبع: arXiv AI
