تا به حال برایتان پیش آمده که بخواهید متنی را داخل یک عکس با هوش مصنوعی تغییر دهید، اما نتیجه نهایی تار یا ناخوانا شود؟ مدلهای فعلی معمولاً در ویرایش دقیق متون درون تصاویر ضعف دارند.
محققان بهتازگی فریمورک جدیدی به نام WeEdit را معرفی کردهاند که با استفاده از راهکارهای «گلیفمحور» (Glyph-guided) و یک سیستم آموزشی دو مرحلهای، دقیقاً روی اصلاح و ویرایش متون در تصویر تمرکز دارد. این پروژه شامل یک دیتاسیت عظیم ۳۳۰ هزارتایی و بنچمارکهای استاندارد برای ۱۵ زبان مختلف است که میتواند دقت ویرایش متون در عکسها را به سطح جدیدی برساند.
آیا این دستاورد میتواند مشکل «توهمات متنی» در هوش مصنوعی را برای همیشه حل کند؟
منبع: arXiv Computer Vision
