دانشمندان در مقاله جدیدی، روشی نوآورانه برای «توسعه توکنایزر» (Tokenizer Expansion) معرفی کردهاند که به مدلهای زبانی بزرگ (LLM) اجازه میدهد بدون نیاز به آموزش از صفر، دایره لغات خود را گسترش دهند.
این تکنیک بهویژه برای مدلهای روی دستگاه (On-device) بسیار حیاتی است؛ چرا که با بهینهسازی توکنبندی، سرعت مدل را بالا برده و مصرف انرژی و حافظه را برای زبانهای جدید کاهش میدهد. با این متد، مدلهای کوچکتر هم میتوانند به کارایی مدلهای ابری بزرگ دست پیدا کنند. 🚀
منبع: arXiv Machine Learning
