محققان به تازگی شبکه جدیدی به نام «MGCA-Net» را برای حل یکی از چالشهای بزرگ هوش مصنوعی، یعنی «مکانیابی زمانی فعالیتها» (Temporal Action Localization) معرفی کردهاند.
این مدل با استفاده از رویکرد «دانهبندی چندگانه» (Multi-Grained)، میتواند حرکات و فعالیتهای مختلف در ویدیو را بسیار دقیقتر از قبل شناسایی و دستهبندی کند؛ آن هم بدون اینکه نیاز باشد از قبل برای تمام آن دستهها آموزش دیده باشد (Open-Vocabulary).
این نوآوری به مدلهای بینایی ماشین کمک میکند تا با نگاهی دقیقتر به ویدیوها، فعالیتهای جدید و ناشناخته را در سطوح مختلف (از کلی تا جزئی) درک کنند. گام بزرگی برای کاربردهای نظارتی و تحلیلهای هوشمند ویدیویی! 🧠✨
منبع: arXiv Computer Vision
