🔍 مدل‌های بینایی-زبانی در خواندن متن‌های تصویری چقدر دقیق هستند؟

🧠 چرا هوش مصنوعی گاهی «خیالات» می‌بیند؟

تا به حال فکر کرده‌اید که آیا هوش مصنوعی متن‌های داخل تصویر (مانند نوشته‌های روی بیلبوردها یا اسناد اسکن شده) را به همان خوبی متن‌های تایپی ساده می‌فهمد؟ 🤔

محققان به‌تازگی بنچمارک جدیدی به نام VISTA-Bench را معرفی کرده‌اند که عملکرد بیش از ۳۰ مدل بزرگ بینایی-زبانی (VLM) را بررسی می‌کند. نتایج جالب است: این مدل‌ها وقتی با «متن‌های بصری» مواجه می‌شوند، عملکردشان به‌شدت افت می‌کند! این یعنی با وجود پیشرفت‌های خیره‌کننده، هنوز شکاف بزرگی در درک معنایی بین متنِ تایپ شده و متنِ رندر شده در پیکسل‌ها وجود دارد.

این تحقیق گامی مهم برای ساخت مدل‌های هوشمندتر و یکپارچه‌تر است تا دیگر «دیدن» یک نوشته، به معنای «درک نکردن» آن نباشد! 🧠✨

🔗 دسترسی به کد و داده‌های VISTA-Bench

منبع: arXiv Computer Vision