مدلهای بزرگ زبانی (LLM) معمولاً با دادههای مدرن آموزش دیدهاند و در درک ساختار پیچیده زبانهای کلاسیک مثل سانسکریت یا تامیل ضعف دارند. حالا محققان با معرفی «BHARATI»، مجموعهای از توکنایزرهای بهینه را طراحی کردهاند که بهطور اختصاصی برای زبانهای هندی با ساختارهای پیچیده صرفی و آوایی آموزش دیدهاند.
نتایج نشان میدهد که BHARATI تا ۲ برابر در توکنبندی کلمات تخصصی «دانش هندی» (IKS) نسبت به مدلهای مرسوم مثل GPT-2 کارآمدتر عمل میکند و طول دنبالهها را بهشدت کاهش میدهد. گامی مهم برای درگیر کردن زبانهای باستانی در عصر هوش مصنوعی! 🌐
شناسی_رایانشی
منبع: arXiv Machine Learning
