تا حالا فکر کردید که مدلهای بینایی-زبانی چطور ویدیوها را توصیف میکنند؟ معمولاً این توصیفها کلی هستند، اما مدل جدید «VEGAS» آمده تا این تجربه را کاملاً شخصیسازی کند. ✨
محققان با استفاده از دادههای «ردیابی چشم» (Gaze)، روشی ابداع کردهاند که به هوش مصنوعی اجازه میدهد دقیقاً روی همان بخشهایی از ویدیو تمرکز کند که چشم انسان در آن لحظه به آن خیره شده است. این یعنی توصیفهایی که نه تنها هوشمندانه، بلکه کاملاً مطابق با توجه و تمرکز بیننده هستند. 🎯
این نوآوری جذاب به مدلهای هوش مصنوعی کمک میکند تا درک بسیار دقیقتری از محتوای بصری داشته باشند و در آینده شاهد جستجوی ویدیویی هوشمندتر و تعاملیتری خواهیم بود.
منبع: arXiv Computer Vision
