محققان مدل پیشرفتهای به نام Q-TriM را توسعه دادهاند که انقلابی در حوزهی «پرسش و پاسخ صوتی-تصویری» (AVQA) ایجاد کرده است.
مشکل مدلهای قبلی این بود که با لایههای متوالی و عمیق برای ترکیب اطلاعات صدا و تصویر، جزئیات مهم را از دست میدادند. حالا Q-TriM با استفاده از یک روش نوآورانه و موازی، اطلاعات متن، تصویر و صدا را به صورت همزمان و دقیقتر ترکیب میکند که نتیجه آن کسب بهترین عملکرد در بنچمارکهای معتبر جهانی است. این پیشرفت یعنی هوش مصنوعی در تحلیل ویدئوها بسیار هوشمندتر و دقیقتر عمل خواهد کرد! 🎬🔊
منبع: arXiv AI
