یکی از چالشهای بزرگ در بینایی ماشین، تحلیل خودکار ویدیوهای طولانی و تشخیص بخشهای مختلف حرکتی (Action Segmentation) است. روشهای فعلی معمولاً از مدلهای قطعی استفاده میکنند که باعث میشود دقت تحلیل در موقعیتهای پیچیده کاهش یابد.
محققان در پژوهش جدیدی، رویکردی مبتنی بر «جاسازی احتمالی» (Probabilistic Embeddings) معرفی کردهاند که با مدلسازی توزیعهای گوسی برای فریمهای ویدیویی، فرآیند یادگیری را بسیار بهینهتر کرده است. نتایج این مدل در مقایسه با روشهای قبلی، بهبود قابل توجهی (تا ۲۰ درصد در دقت) را نشان میدهد که میتواند در آینده کاربردهای زیادی در سیستمهای نظارتی، تحلیل ورزشی و ویدیوهای تعاملی داشته باشد.
اگر به جزئیات فنی علاقهمندید، کد این پروژه در گیتهاب در دسترس است.
منبع: arXiv Computer Vision
