محققان در مطالعهای جدید به سراغ این پرسش جالب رفتهاند که آیا نمایشهای پیچیدهتر و غنیتر بصری، همیشه با درک و نگاه انسان همخوانی بیشتری دارند؟
🔹 نکات کلیدی این پژوهش:
تحلیل روی بیش از ۵۰ هزار کلیپ از پیادهروی در شهر انجام شده تا مشخص شود مدلهای هوش مصنوعی چطور «لحظات جذاب» (Engaging) را در ویدیوها تشخیص میدهند.
نتایج نشان میدهد برخلاف تصور، ویدیوهای بسیار غنی همیشه برتر نیستند! در بسیاری از مواقع، تصاویر ثابتِ میانگینگیری شده (TAIs) در تشخیص لحظات جذاب، عملکردی مشابه یا حتی بهتر از ویدیوهای کامل دارند.
این یافتهها به ما کمک میکند تا مدلهای بینایی ماشین را برای درک بهترِ محیطهای شهری، هوشمندانهتر طراحی کنیم. در واقع گاهی سادگی، همراستایی بیشتری با درک انسان دارد! 🧠✨
منبع: arXiv Computer Vision
