🔍 آیا مدل‌های بینایی-زبانی (VLM) واقعاً متن‌ها را می‌خوانند یا آن‌ها را بازنویسی می‌کنند؟ 🤖

🧠 چرا هوش مصنوعی گاهی «خیالات» می‌بیند؟

محققان در مقاله‌ای تازه به چالش مهمی در هوش مصنوعی دست یافته‌اند: مدل‌های VLM که جایگزین OCR سنتی شده‌اند، همیشه وفادار نیستند! طبق این مطالعه، وقتی با متون ناقص یا بهم‌ریخته مواجه می‌شوند، به جای خواندن دقیق، تمایل دارند متن را «بازنویسی» کنند تا معنای منطقی‌تری داشته باشد. 📝

این یعنی در بنچمارک‌های فعلی، دقت مدل‌ها گاهی فریبنده است. محققان با معرفی بنچمارک FaithC4 نشان دادند که مدل‌های عمومی VLM بیشتر از مدل‌های تخصصی OCR مستعد این بازنویسی خودسرانه هستند. جالب اینجاست که این رفتار در کلمات کوتاه بیشتر دیده می‌شود و با طولانی‌تر شدن کلمات، دقت مدل‌ها افزایش می‌یابد.

این کشف اهمیت توسعه ابزارهای دقیق‌تر برای درک مستندات در دنیای هوش مصنوعی را بیش از پیش نشان می‌دهد. 💡

منبع: arXiv AI