محققان در دستاوردی تازه، راهکار جدیدی برای بهبود نویسهخوان نوری (OCR) زبانهایی مثل مالتی (Maltese) ارائه دادهاند. چالش اصلی این زبانها، کمبود منابع آموزشی است که تیم تحقیق با استفاده از دادههای سنتتیک (مصنوعی) و یک سیستم آرایشی چندجریانی، دقت مدل Tesseract را تا ۴۴٪ افزایش دادهاند. این پیشرفت گام مهمی برای دیجیتالیسازی متون زبانهای کمتر دیده شده با استفاده از هوش مصنوعی است. 🤖✨
منبع: arXiv NLP
