🔍 مالیات نامرئی توکنایزرها برای زبان‌های غیرانگلیسی!

🧠 چرا هوش مصنوعی گاهی «خیالات» می‌بیند؟

تا حالا فکر کردید چرا مدل‌های زبانی در برخی زبان‌ها ضعیف‌تر عمل می‌کنند؟ یک پژوهش جدید نشان می‌دهد که توکنایزرهای فعلی (مخصوصاً در مدل‌هایی مثل GPT-4) با زبان‌هایی غیر از انگلیسی به‌شدت نامهربان هستند!

🔹 ماجرا چیست؟
توکنایزرها متن را به قطعات کوچک (Token) تبدیل می‌کنند. به دلیل آموزش‌ دیدن روی داده‌های عمدتاً انگلیسی، این سیستم‌ها برای زبان‌های دیگر (مثل زبان‌های هند) باعث تکه‌تکه شدن بیش از حد کلمات می‌شوند.

🔹 نتایج جالب این تحقیق:
– برای زبان‌های هندی، حجم توکن‌ها به‌طور متوسط ۸ برابر بیشتر از انگلیسی است (گاهی تا ۱۳ برابر!).
– این یعنی «پنجره متن» (Context Window) برای این زبان‌ها تا ۸۸٪ کوچک‌تر می‌شود و عملاً بخش بزرگی از ظرفیت مدل هدر می‌رود.
– خبر خوب؟ استفاده از توکنایزرهای چندزبانه مدرن (مثل o200k_base) می‌تواند این مشکل را تا ۷۳٪ بهبود ببخشد.

این تحقیق یادآوری می‌کند که برای رسیدن به عدالت در هوش مصنوعی، باید نگاه دقیق‌تری به طراحی فنی زیرساخت‌ها داشته باشیم. 💡

منبع: arXiv Machine Learning