تا به حال فکر کردهاید که آیا هوش مصنوعی متنهای داخل تصویر (مانند نوشتههای روی بیلبوردها یا اسناد اسکن شده) را به همان خوبی متنهای تایپی ساده میفهمد؟ 🤔
محققان بهتازگی بنچمارک جدیدی به نام VISTA-Bench را معرفی کردهاند که عملکرد بیش از ۳۰ مدل بزرگ بینایی-زبانی (VLM) را بررسی میکند. نتایج جالب است: این مدلها وقتی با «متنهای بصری» مواجه میشوند، عملکردشان بهشدت افت میکند! این یعنی با وجود پیشرفتهای خیرهکننده، هنوز شکاف بزرگی در درک معنایی بین متنِ تایپ شده و متنِ رندر شده در پیکسلها وجود دارد.
این تحقیق گامی مهم برای ساخت مدلهای هوشمندتر و یکپارچهتر است تا دیگر «دیدن» یک نوشته، به معنای «درک نکردن» آن نباشد! 🧠✨
🔗 دسترسی به کد و دادههای VISTA-Bench
منبع: arXiv Computer Vision
