🚀 هوش مصنوعی جدید برای درک عمیق‌تر صدا و تصویر: مدل SHRIKE

🧠 چرا هوش مصنوعی گاهی «خیالات» می‌بیند؟

محققان به تازگی مدل جدید و قدرتمندی به نام SHRIKE معرفی کردند که در زمینه پرسش و پاسخ صوتی-تصویری (Audio-Visual QA) غوغا کرده است! 🎬🎵

این مدل با ترکیب دو تکنولوژی پیشرفته:
۱. گراف صحنه چندوجهی (Multi-Modal Scene Graph) برای شناسایی دقیق اشیاء و روابط آن‌ها در ویدیو.
۲. شبکه‌های عصبی کولموگوروف-آرنولد (KAN) در ساختار Mixture of Experts.

توانسته است رکورد دقت در بنچمارک MUSIC-AVQA را جابه‌جا کند و با رسیدن به دقت ۷۸.۱۴٪، بهترین عملکرد تا به امروز را به ثبت برساند. این پیشرفت یعنی مدل‌های هوش مصنوعی حالا خیلی بهتر از قبل، محتواهای پیچیده صوتی و تصویری را «می‌فهمند».

منبع: arXiv AI