محققان در پژوهشی جدید، مدل هوشمند «DensFiLM» را معرفی کردهاند که تحولی در نحوه تحلیلِ ویدیوهای شلوغ ایجاد میکند. این مدل با درکِ متفاوت از تراکم جمعیت، توجه هوش مصنوعی را در صحنههای خلوت روی تکتک افراد و در صحنههای شلوغ روی حرکتهای جمعی و نقاط کلیدی متمرکز میکند.
این فناوری که از لایههای سبک و بهینهای در دل «Video Swin Transformer» استفاده میکند، توانسته دقت تشخیصِ بصری (Saliency) را بهطور چشمگیری افزایش دهد، بدون اینکه نیاز به افزایش سنگین پارامترهای مدل باشد. گامی رو به جلو برای سیستمهای نظارتی و تحلیلهای ویدئویی هوشمند! 🎥🤖
منبع: arXiv Computer Vision
