تکنولوژی تشخیص متن در تصاویر (Scene Text Recognition) همیشه با چالشهایی مثل چرخش متن یا پرسپکتیوهای پیچیده روبرو بوده است. مدلهای ترنسفورمر فعلی اغلب ساختار دو بعدی تصویر را نادیده میگیرند، اما در مقاله جدید، روش 2D-RoPE-STR معرفی شده که این مشکل را حل میکند.
این روش با بهرهگیری از یک سیستم مکانیابی جدید، به مدل کمک میکند تا چیدمان دوبعدی متن را در تصاویر (حتی متون کج یا پیچیده) بهتر درک کند. نکته جذاب اینجاست که این بهبود بدون نیاز به تغییرات سنگین معماری و به صورت کاملاً بهینه انجام شده است. گام دیگری به سوی خواندن دقیقتر و سریعتر متون توسط هوش مصنوعی! 🤖✨
منبع: arXiv Computer Vision
