🚀 انقلاب در ویرایش متن‌های داخل تصویر؛ معرفی WeEdit! ✍️🎨

⚠️ هشدار به محققان: چرا دقت مدل‌های شناسایی پهپاد گاهی «واقعی» نیست؟

تا به حال برایتان پیش آمده که بخواهید متنی را داخل یک عکس با هوش مصنوعی تغییر دهید، اما نتیجه نهایی تار یا ناخوانا شود؟ مدل‌های فعلی معمولاً در ویرایش دقیق متون درون تصاویر ضعف دارند.

محققان به‌تازگی فریم‌ورک جدیدی به نام WeEdit را معرفی کرده‌اند که با استفاده از راهکارهای «گلیف‌محور» (Glyph-guided) و یک سیستم آموزشی دو مرحله‌ای، دقیقاً روی اصلاح و ویرایش متون در تصویر تمرکز دارد. این پروژه شامل یک دیتاسیت عظیم ۳۳۰ هزارتایی و بنچمارک‌های استاندارد برای ۱۵ زبان مختلف است که می‌تواند دقت ویرایش متون در عکس‌ها را به سطح جدیدی برساند.

آیا این دستاورد می‌تواند مشکل «توهمات متنی» در هوش مصنوعی را برای همیشه حل کند؟

منبع: arXiv Computer Vision