تشخیص «اکشنها» در ویدئوهای پیچیده همیشه چالش بزرگی بوده، چون مدلهای فعلی معمولاً کلینگر هستند و جزئیات ریز را نادیده میگیرند. اما محققان در مقاله جدیدی، مدل نوآورانه KDA (Knowledge-guided Disentanglement) را معرفی کردند که با کمک مدلهای زبانی (LLM)، ویدئوها را به «حرکات اتمی» یا همان اجزای سازنده تجزیه میکند.
این روش با تزریق دانش معنایی به مدل، باعث میشود سیستم بتواند حرکات ظریف و پیچیده را با دقت بسیار بالاتری تشخیص دهد. این پیشرفت گامی بزرگ برای بهبود سیستمهای تحلیل ویدئو، دوربینهای نظارتی هوشمند و تحلیل رفتارهای انسانی است. 🧠✨
منبع: arXiv Computer Vision
