محققان در مقالهای تازه به چالش مهمی در هوش مصنوعی دست یافتهاند: مدلهای VLM که جایگزین OCR سنتی شدهاند، همیشه وفادار نیستند! طبق این مطالعه، وقتی با متون ناقص یا بهمریخته مواجه میشوند، به جای خواندن دقیق، تمایل دارند متن را «بازنویسی» کنند تا معنای منطقیتری داشته باشد. 📝
این یعنی در بنچمارکهای فعلی، دقت مدلها گاهی فریبنده است. محققان با معرفی بنچمارک FaithC4 نشان دادند که مدلهای عمومی VLM بیشتر از مدلهای تخصصی OCR مستعد این بازنویسی خودسرانه هستند. جالب اینجاست که این رفتار در کلمات کوتاه بیشتر دیده میشود و با طولانیتر شدن کلمات، دقت مدلها افزایش مییابد.
این کشف اهمیت توسعه ابزارهای دقیقتر برای درک مستندات در دنیای هوش مصنوعی را بیش از پیش نشان میدهد. 💡
منبع: arXiv AI
