محققان به چالش بزرگی در آموزش مدلهای زبانی (LLM) برخورد کردهاند؛ جایی که مدلها در حین یادگیری مراحل استدلالی، دچار «بنبست بهینهسازی» میشوند و خروجیهای نامعتبر تولید میکنند.
اما راهکار چیست؟ روش جدیدی به نام CIGPO با تزریق هوشمندانه «پاداشهای مرحلهای» به فرآیند یادگیری، از فروپاشی مدل جلوگیری میکند. این رویکرد باعث شده مدلهای کوچک (مثل Qwen2.5-3B) در پاسخدهی به سوالات پیچیده، جهش عملکرد خیرهکنندهای را تجربه کنند و بسیار دقیقتر عمل کنند. این یعنی راه برای ساخت مدلهای هوشمندتر با منابع پردازشی کمتر هموارتر شده است! 🧠✨
منبع: arXiv AI
