مدلهای بینایی-زبانی (VLM) که این روزها در خواندن متون (OCR) غوغا کردهاند، هنوز هم میتوانند ما را غافلگیر کنند!
محققان در مطالعه جدیدی بر روی اسناد تاریخی متوجه شدند که با وجود عملکرد خیرهکننده این مدلها در معیارهای عددی (مثل CER و WER)، آنها هنوز مستعد «توهم» (Hallucination) هستند.
نکته جالب اینجاست که این مدلها ممکن است با تغییر کلمات، جملاتی کاملاً روان اما اشتباه تولید کنند که در تحلیلهای معمولی دیده نمیشود؛ موضوعی که بهویژه در اسناد حساس تاریخی میتواند دردسرساز شود. این تحقیق یادآوری میکند که هنوز تا جایگزینی کامل هوش مصنوعی با دقت انسانی در اسناد مهم، راه باقی است.
منبع: arXiv Computer Vision
