تولید متن در تصاویر همیشه یکی از چالشهای اصلی هوش مصنوعی بوده، به خصوص برای فونتهای ریز یا زبانهایی غیر از انگلیسی. حالا محققان مدل جدیدی به نام «InnoText» معرفی کردهاند که این مشکل را حل میکند.
ویژگیهای کلیدی این مدل:
✅ یکپارچهسازی تولید و ویرایش متن در یک مدل واحد
✅ استفاده از ماژول FSAM برای حفظ کیفیت در سایزهای مختلف فونت
✅ پشتیبانی عالی از زبانهای انگلیسی و چینی
✅ دقت بسیار بالاتر در تولید متون خوانا و باکیفیت
این مدل با استفاده از معماری DiT، استاندارد جدیدی برای جایگذاری متن در عکسها ایجاد کرده که میتواند در طراحی گرافیک و تولید محتوای خودکار بسیار کاربردی باشد.
منبع: arXiv Computer Vision
