محققان به تازگی مدل جدید و قدرتمندی به نام SHRIKE معرفی کردند که در زمینه پرسش و پاسخ صوتی-تصویری (Audio-Visual QA) غوغا کرده است! 🎬🎵
این مدل با ترکیب دو تکنولوژی پیشرفته:
۱. گراف صحنه چندوجهی (Multi-Modal Scene Graph) برای شناسایی دقیق اشیاء و روابط آنها در ویدیو.
۲. شبکههای عصبی کولموگوروف-آرنولد (KAN) در ساختار Mixture of Experts.
توانسته است رکورد دقت در بنچمارک MUSIC-AVQA را جابهجا کند و با رسیدن به دقت ۷۸.۱۴٪، بهترین عملکرد تا به امروز را به ثبت برساند. این پیشرفت یعنی مدلهای هوش مصنوعی حالا خیلی بهتر از قبل، محتواهای پیچیده صوتی و تصویری را «میفهمند».
منبع: arXiv AI
