محققان در تازهترین پژوهش خود، با استفاده از مدلهای ByT5 و mT5، موفق شدند سیستم ترجمه ماشینی موثری برای زبان «تانگخول» (Tangkhul) طراحی کنند. این زبان که در هند صحبت میشود و جزو زبانهای کممنابع (Low-resource) محسوب میشود، تاکنون زیرساختهای پردازش زبان طبیعی (NLP) بسیار محدودی داشته است.
این دستاورد نشان میدهد که چگونه میتوان با ترکیب دانش فنی و دادههای محدود، مدلهای زبانی را برای زبانهای مهجورتر جهان بهینهسازی کرد و به حفظ آنها کمک کرد. این تلاشها نقطه امیدی برای دیجیتالیسازی زبانهای بومی دنیاست. 🤖✨
منبع: arXiv NLP
