محققان دنیای هوش مصنوعی بهتازگی از مدل قدرتمند و نوآورانهای به نام XOV-Action رونمایی کردند که برای حل یکی از چالشهای بزرگ ویدئوها یعنی «تشخیص فعالیتها» (Action Recognition) طراحی شده است.
چرا این خبر مهم است؟
مدلهای فعلی معمولاً در مواجهه با ویدئوهایی که قبلاً ندیدهاند، دچار سردرگمی میشوند. اما XOV-Action با دو قابلیت کلیدی، این مشکل را حل کرده است:
1️⃣ درک مفاهیم جدید و ناشناخته (Open-Set).
2️⃣ هوشمندی در شناسایی فعالیتها فارغ از محیط و صحنه ویدئو (Scene-agnostic).
آنها همچنین بنچمارک جدیدی به نام XOVABench را معرفی کردهاند که به محققان کمک میکند قدرت مدلهای خود را در دنیای واقعی بهتر بسنجند. این یعنی حرکت به سمت هوش مصنوعی که میتواند ویدئوها را مثل انسان و در هر شرایطی درک کند! 🎬🤖
منبع: arXiv Computer Vision
