یکی از چالشهای اصلی در پردازش متن فارسی توسط هوش مصنوعی (OCR)، پیچیدگیهای خط فارسی مثل اتصالات حروف، رسمالخطهای مختلف و کمبود دادههای آموزشی باکیفیت است. حالا محققان با معرفی دیتاسیت جدید «Persian Pixel»، این مسیر را هموار کردهاند.
این دیتاسیت شامل بیش از ۳۴۳ هزار تصویر و متنِ جفتشده است که بر اساس ۷ میلیون کلمه ساخته شده و میتواند کیفیتِ سیستمهای هوش مصنوعی در خواندن و دیجیتالی کردن اسناد فارسی را به شکل چشمگیری افزایش دهد. خبر بسیار خوبی برای توسعهدهندگانی که روی مدلهای زبان و بینایی ماشین فارسی کار میکنند! 🇮🇷✨
منبع: arXiv AI
