محققان در مقالهای جدید، تکنیک نوآورانهای به نام «DualKV» را معرفی کردهاند که به طور چشمگیری سرعت آموزش مدلهای زبانی (RL Training) را افزایش میدهد. ⚡️
ماجرا از این قرار است که در فرآیندهای یادگیری تقویتی (RL)، مدلها مجبورند پرامپتهای مشترک را برای هزاران پاسخ مختلف تکرار کنند که باعث هدررفت حافظه و قدرت پردازشی میشود. DualKV با بهینهسازی هستههای CUDA و بازطراحی خط لوله دادهها، این تکرارهای بیهوده را حذف میکند.
نتایج فوقالعاده است: در مدلهای Qwen3 با این روش، سرعت آپدیت سیاست (Policy Update) تا ۲ برابر افزایش یافته و امکان استفاده از دستههای داده (Micro-batches) بزرگتر فراهم شده است. این یک خبر عالی برای توسعهدهندگانی است که با مدلهای دارای پنجره متنی (Context Window) طولانی کار میکنند! 🧠💡
منبع: arXiv Machine Learning
