تا امروز فکر میکردیم متنها حتماً باید به «توکن» تبدیل شوند تا مدلهای زبانی آنها را بفهمند، اما یک تحقیق جدید ثابت کرده که شاید راه بهتری هم وجود داشته باشد!
محققان در این مطالعه نشان دادند که برای زبانهایی مثل چینی، استفاده از «تصویر کاراکترها» (Glyph Images) به جای امبدینگهای متنی کلاسیک، نه تنها دقت مدل را تا ۲۱٪ افزایش میدهد، بلکه سرعت آموزش را هم تقریباً دو برابر میکند! این یعنی مدل با دیدن تصویر حروف، درک بهتری از ساختار و معنا پیدا میکند.
این تحقیق گامی بزرگ در بازنگریِ معماریهای فعلی هوش مصنوعی است و نشان میدهد شاید آینده مدلهای زبانی نه در توکنهای انتزاعی، بلکه در درک بصری نهفته باشد.
منبع: arXiv AI
