دانشمندان حوزه هوش مصنوعی ابزار جدیدی به نام MAVEN طراحی کردهاند که به طور خودکار ویدیوهای خام را به دادههای آموزشی باکیفیت تبدیل میکند.
این ابزار به جای برچسبگذاری دستی، از یک رویکرد «عاملمحور» (Agentic) برای درک وقایع، زمانبندی و علت رویدادها استفاده میکند. نکته جذاب اینجاست که MAVEN میتواند در صورت بروز خطا، خودش را اصلاح کند و مدلهای بینایی-زبانی (VLM) را تا حدی تقویت کند که از مدلهای قدرتمندی مثل Gemini 2.5 Pro در تحلیلهای ویدیویی پیشی بگیرند. 🚀
این پیشرفت میتواند سرعت توسعه هوش مصنوعی در درک ویدیوهای نظارتی و محیطی را به شدت افزایش دهد.
منبع: arXiv Computer Vision
