محققان در یک پژوهش جدید، مدل نوآورانه AV-JEPA را معرفی کردهاند که یادگیری خودنظارتی (Self-Supervised Learning) را در دادههای صوتی و تصویری متحول میکند.
این مدل با بهرهگیری از یک معماری ساده اما قدرتمند (بدون نیاز به دیکودر یا توابع زیان پیچیده)، توانسته است هماهنگی بسیار بالایی در فضای نهفته بین صوت و تصویر ایجاد کند. از ویژگیهای جذاب AV-JEPA میتوان به عملکرد عالی در دستهبندی و همچنین قابلیت جستجوی بدون آموزش (Zero-shot) در فایلهای صوتی و تصویری اشاره کرد. این یعنی هوش مصنوعی حالا بهتر از همیشه میتواند بفهمد چه چیزی را در ویدیو میبیند و میشنود!
منبع: arXiv AI
