محققان در تازهترین دستاورد خود، مدل جدیدی به نام «Gazette» را معرفی کردهاند که میتواند حرکات چشم (Gaze) را به متنهای توصیفی تبدیل کند! 📝
تا پیش از این، سیستمهای ردیابی چشم تنها قادر به تشخیص دستهبندیهای محدود بودند، اما «Gazette» با بهرهگیری از مدلهای زبانی چندوجهی (MLLM)، میتواند اهداف و نیات انسان را از روی مسیر حرکت چشم در محیطهای مختلف، به زبان طبیعی توصیف کند.
این مدل با استفاده از یک استراتژی هوشمندانه که دادههای خام چشم را به «روایتهای فکری» (Think-aloud transcripts) تبدیل میکند، قادر است پیچیدگیهای ذهنی کاربر را درک کرده و با دقت خیرهکنندهای تحلیل کند. این یعنی یک گام بزرگ به سمت رابطهای کاربری هوشمندتر که بدون نیاز به گفتار یا تایپ، منظور ما را میفهمند! 🚀
منبع: arXiv Computer Vision
