تا به حال شده بخواهید از اسناد متنی و تصویری شلوغ، اطلاعات دقیقی بیرون بکشید؟ روشهای قدیمی که بر پایه OCR بودند، معمولاً کند یا نیازمند دادههای آموزشی حجیم بودند. اما محققان یک فریمورک جدید و قدرتمند معرفی کردهاند!
💡 این روش با استفاده از مدلهای بینایی-زبانی (مثل Qwen2.5-VL)، دستهبندی نوع سند را از استخراج محتوا جدا میکند و با بهرهگیری از یادگیری درونمتنی (In-context Learning)، حتی روی اسناد ناخوانا، دارای مهر یا واترمارک هم عملکرد فوقالعادهای دارد.
نتایج آزمایشها نشان میدهد که این متد، در مقایسه با روشهای سنتی، جهش قابل توجهی در دقت (F1-score) داشته و برای اتوماسیون اداری یک راهکارِ بسیار بهینه و مقیاسپذیر محسوب میشود. آینده اسناد دیجیتال بدون خطا در حال رقم خوردن است! 🚀
منبع: arXiv Computer Vision
