اگر با مدلهای زبانی بزرگ کار کرده باشید، میدانید که محاسبات مربوط به واژگان (Vocabulary) چقدر سنگین و هزینهبر است. محققان به تازگی رویکرد نوآورانهای به نام «CSV-Decode» معرفی کردهاند که این چالش را هدف قرار داده است.
این روش با ساختن زیر-واژگان کوچک برای هر مرحله از دیکودینگ، به مدل اجازه میدهد به جای محاسبات کامل و سنگین، تنها روی بخشهای ضروری تمرکز کند. جالب اینجاست که این بهینهسازی، دقت مدل را فدای سرعت نمیکند و تضمینهای ریاضی برای صحت خروجی ارائه میدهد.
این دستاورد که با استفاده از کرنلهای بهینهسازی شده CUDA پیادهسازی شده، گام بزرگی برای کاهش هزینههای استنتاج (Inference) در دنیای LLMها محسوب میشود.
🔗 لینک پروژه: https://github.com/FastLM/CSV-Decode
سازی
منبع: arXiv NLP
