دنیای مدلهای زبانی چندوجهی (AV-LLMs) با معرفی مدل جدید AV-Flamingo وارد فاز تازهای شد! برخلاف مدلهای قبلی که بیشتر روی کلیپهای کوتاه متمرکز بودند، این مدل برای تحلیل و استدلال دقیق روی ویدئوهای طولانی و پیچیده طراحی شده است.
ویژگیهای کلیدی این مدل جدید:
✅ استفاده از دیتاست عظیم Audio-Visual-Skills با ۷ میلیون نمونه آموزشی برای بهبود درک زمانی و صوتی-تصویری.
✅ معماری آموزشی سه مرحلهای از ادراک کوتاهمدت تا استدلالهای بلندمدت.
✅ بهرهگیری از زنجیره افکار (Chain-of-Thought) برای ارجاع دقیق به زمانبندی ویدئوها که باعث افزایش چشمگیر دقت و تفسیرپذیری میشود.
نتایج آزمایشها نشان میدهد که این مدل حتی از رقبای بسیار بزرگتر از خود در بنچمارکهای ویدئویی پیشی گرفته است! دنیای هوش مصنوعی روز به روز در درک جهان واقعی دقیقتر میشود.
منبع: arXiv Computer Vision
