آیا میدانستید که مدلهای هوش مصنوعی فعلی در درک زبانهای مختلف با هم برابر نیستند؟ سیستمهای فعلی معمولاً به زبانهایی که دادههای آموزشی بیشتری دارند (مثل انگلیسی) اولویت میدهند و این یعنی توکنسازی برای زبانهای کممنابع، ناکارآمد و پرهزینه است.
محققان به تازگی روش نوآورانهای به نام «Parity-aware BPE» معرفی کردهاند که این نابرابری را هدف قرار میدهد! 🛠️
این روش با تغییر قوانین «توکنسازی»، به جای تمرکز صرف بر فشردهسازی کلی، به دنبال تعادل و عدالت بین تمام زبانهاست. نتیجه چیست؟ کاهش ۸۹ درصدی نابرابری در هزینههای توکنسازی بدون اینکه سرعت یا عملکرد مدل آسیب ببیند. گامی مهم برای دموکراتیزه کردن هوش مصنوعی برای همه زبانهای دنیا! 🌍✨
منبع: arXiv AI
