🎬 دقت در تشخیص حرکات ویدئویی با قدرت مدل‌های زبانی: معرفی مدل KDA

🧠 چرا هوش مصنوعی گاهی «خیالات» می‌بیند؟

تشخیص «اکشن‌ها» در ویدئوهای پیچیده همیشه چالش بزرگی بوده، چون مدل‌های فعلی معمولاً کلی‌نگر هستند و جزئیات ریز را نادیده می‌گیرند. اما محققان در مقاله جدیدی، مدل نوآورانه KDA (Knowledge-guided Disentanglement) را معرفی کردند که با کمک مدل‌های زبانی (LLM)، ویدئوها را به «حرکات اتمی» یا همان اجزای سازنده تجزیه می‌کند.

این روش با تزریق دانش معنایی به مدل، باعث می‌شود سیستم بتواند حرکات ظریف و پیچیده را با دقت بسیار بالاتری تشخیص دهد. این پیشرفت گامی بزرگ برای بهبود سیستم‌های تحلیل ویدئو، دوربین‌های نظارتی هوشمند و تحلیل رفتارهای انسانی است. 🧠✨

منبع: arXiv Computer Vision