🚀 جهشی در سرعت پردازش ویدیو با هوش مصنوعی!

⚠️ هشدار به محققان: چرا دقت مدل‌های شناسایی پهپاد گاهی «واقعی» نیست؟

محققان در مقاله‌ای جدید، راهکار نوآورانه‌ای برای «تولید کپشن‌های متراکم ویدیو» (Dense Video Captioning) معرفی کردند. تا پیش از این، مدل‌های زبانی بزرگ برای توصیف ویدیو، توکن‌ها را به صورت ترتیبی پردازش می‌کردند که باعث کندی شدید در ویدیوهای طولانی می‌شد.

در این روش جدید با استفاده از «رمزگشایی اتورگرسیو موازی» (Parallelized Autoregressive Decoding)، مدل می‌تواند با درک وابستگی‌های محلی بین رویدادها، بخش‌های مختلف کپشن را همزمان تولید کند. این یعنی سرعت بسیار بالاتر در کنار دقت عالی در درک محتوای ویدیویی!

این پیشرفت می‌تواند به زودی باعث شود مدل‌های هوش مصنوعی ویدیو را سریع‌تر و دقیق‌تر از همیشه تحلیل و توصیف کنند.

منبع: arXiv AI