محققان حوزه هوش مصنوعی بهتازگی از چارچوب جدیدی به نام OpenCoF رونمایی کردهاند که رویکرد متفاوتی را برای «استدلال» در مدلهای ویدیویی دنبال میکند. برخلاف روشهای سنتی که بر متن تمرکز داشتند، این مدل با استفاده از «زنجیره فریمها» (Chain-of-Frame)، استدلال را از طریق توالیهای تصویری و ارتباطات زمانی پیش میبرد.
نکات کلیدی این پژوهش:
🔹 معرفی مجموعه داده OpenCoF-17K با تمرکز بر ۱۱ نوع وظیفه استدلالی مختلف.
🔹 ارتقای مدل Wan2.2 با بهرهگیری از توکنهای ویژه جهت درک بهتر جزئیات بصری و منطق زمانی.
🔹 اثبات اینکه هوش مصنوعی برای استدلال دقیقتر در ویدیو، به نظارت زمانی گستردهتر و ساختارهای میانی نیاز دارد.
این پیشرفت میتواند مسیر ما را برای تولید ویدیوهای هوشمندتر و منطقیتر هموارتر کند. دنیای ویدیوهای AI به سرعت در حال تغییر است! 🚀
منبع: arXiv Computer Vision
