محققان در پژوهشی جدید، فریمورک هوشمندی را معرفی کردهاند که میتواند «تردید» یا «دودلی» انسان را در ویدیوها شناسایی کند! این مدل با ترکیب تحلیل متن، صدا و تصویر (Visual) و استفاده از معماری پیشرفته Cross-Attention، بسیار دقیقتر از مدلهای قبلی عمل میکند.
این فناوری که برای چالشهای ECCV 2026 توسعه یافته، نشان میدهد که ترکیب دادههای چندوجهی چطور میتواند به هوش مصنوعی درک عمیقتری از رفتارهای پیچیده انسانی بدهد. گامی دیگر به سوی تعامل بهتر ماشین و انسان! ✨
منبع: arXiv Computer Vision
