🚀 معماری جدید AV-JEPA؛ گامی بزرگ در درک همزمان صوت و تصویر!

⚠️ هشدار به محققان: چرا دقت مدل‌های شناسایی پهپاد گاهی «واقعی» نیست؟

محققان در یک پژوهش جدید، مدل نوآورانه AV-JEPA را معرفی کرده‌اند که یادگیری خودنظارتی (Self-Supervised Learning) را در داده‌های صوتی و تصویری متحول می‌کند.

این مدل با بهره‌گیری از یک معماری ساده اما قدرتمند (بدون نیاز به دیکودر یا توابع زیان پیچیده)، توانسته است هماهنگی بسیار بالایی در فضای نهفته بین صوت و تصویر ایجاد کند. از ویژگی‌های جذاب AV-JEPA می‌توان به عملکرد عالی در دسته‌بندی و همچنین قابلیت جستجوی بدون آموزش (Zero-shot) در فایل‌های صوتی و تصویری اشاره کرد. این یعنی هوش مصنوعی حالا بهتر از همیشه می‌تواند بفهمد چه چیزی را در ویدیو می‌بیند و می‌شنود!

منبع: arXiv AI