تا حالا فکر کردید چرا مدلهای زبانی در برخی زبانها ضعیفتر عمل میکنند؟ یک پژوهش جدید نشان میدهد که توکنایزرهای فعلی (مخصوصاً در مدلهایی مثل GPT-4) با زبانهایی غیر از انگلیسی بهشدت نامهربان هستند!
🔹 ماجرا چیست؟
توکنایزرها متن را به قطعات کوچک (Token) تبدیل میکنند. به دلیل آموزش دیدن روی دادههای عمدتاً انگلیسی، این سیستمها برای زبانهای دیگر (مثل زبانهای هند) باعث تکهتکه شدن بیش از حد کلمات میشوند.
🔹 نتایج جالب این تحقیق:
– برای زبانهای هندی، حجم توکنها بهطور متوسط ۸ برابر بیشتر از انگلیسی است (گاهی تا ۱۳ برابر!).
– این یعنی «پنجره متن» (Context Window) برای این زبانها تا ۸۸٪ کوچکتر میشود و عملاً بخش بزرگی از ظرفیت مدل هدر میرود.
– خبر خوب؟ استفاده از توکنایزرهای چندزبانه مدرن (مثل o200k_base) میتواند این مشکل را تا ۷۳٪ بهبود ببخشد.
این تحقیق یادآوری میکند که برای رسیدن به عدالت در هوش مصنوعی، باید نگاه دقیقتری به طراحی فنی زیرساختها داشته باشیم. 💡
منبع: arXiv Machine Learning
