محققان روش جدیدی به نام «VIGOR» معرفی کردهاند که میتواند آموزش مدلهای زبانی (LLMs) در زمینههای پیچیده ریاضی و کدنویسی را تا ۲.۳ برابر سریعتر و بهینهتر کند.
مشکل اصلی روشهای فعلی مثل GRPO این است که بخش بزرگی از توان محاسباتی صرف پردازشهای غیرضروری میشود. اما VIGOR با تخصیص هوشمندانه منابع بر اساس «واریانس پاداش»، فقط روی بخشهای چالشبرانگیزتر تمرکز میکند. این یعنی آموزش مدلهای قویتر با صرف زمان و هزینه کمتر! 🧠💻
نویسی
منبع: arXiv AI
