تا حالا دقت کردید که مدلهای تشخیص متن در تصاویر (Scene Text Recognition) با نوشتههای خیلی طولانی مشکل دارند؟ اکثر این مدلها فقط برای جملات کوتاه آموزش دیدهاند و وقتی به یک تابلو یا متنهای متراکم میرسند، گیج میشوند. 🧐
محققان در یک پژوهش جدید، به جای آموزش دوباره مدل (که خیلی هزینهبر است)، یک روش هوشمندانه «بدون نیاز به آموزش» (Training-free) ارائه دادهاند. آنها کشف کردند که مشکل اصلی در بخش «انکودر» مدل است. راهکار آنها این است که تصاویر طولانی را به بخشهای کوچکتر و استاندارد تقسیم کرده، به صورت مستقل پردازش میکنند و سپس با استفاده از الگوریتمهای هندسی، آنها را دقیقاً به هم متصل میکنند. نتیجه؟ عملکردی خیرهکننده که حتی از بهترین مدلهای فعلی هم پیشی میگیرد! 🚀
این یعنی در آینده، هوش مصنوعی در خواندن متنهای پیچیده و طولانیِ موجود در دنیای واقعی، بسیار دقیقتر و سریعتر عمل خواهد کرد. ✨
منبع: arXiv Computer Vision
