محققان در مدل جدید ChineseBERT، فراتر از رویکردهای معمولی عمل کردهاند. این مدل با ترکیب اطلاعات «گلیف» (شکل ظاهری نویسهها) و «پینیین» (تلفظ)، توانسته درک ماشین از زبان چینی را متحول کند.
چرا این خبر مهم است؟
مدلهای زبانی معمولاً جزئیات بصری نویسهها و تفاوتهای ظریف تلفظی (همنامها) را نادیده میگیرند. ChineseBERT با تحلیل ساختار بصری و صوتی، توانسته در تسکهای پیچیدهای مثل درک مطلب و طبقهبندی متن، به رکوردهای جدیدی دست پیدا کند. این یک قدم بزرگ برای توسعه مدلهای تخصصیتر در زبانهایی است که ساختاری متفاوت با الفبای لاتین دارند.
🔗 کدها و مدلهای این پروژه بهصورت متنباز در گیتهاب در دسترس قرار گرفته است.
منبع: arXiv NLP
