یکی از چالشهای بزرگ در مدلهای زبانی، ناتوانی در حل مسائل ریاضی پیچیده به دلیل کمبود دادههای آموزشی با کیفیت است. حالا محققان متد جدیدی به نام AdaKP را معرفی کردهاند که میتواند «نقاط دانش» (Knowledge Points) را بهصورت هوشمند و آنلاین انتخاب کند.
این روش به جای تزریق حجم عظیمی از داده، در هر مرحله از یادگیری تقویتی (RL)، دقیقترین و مفیدترین نکات را برای مدل انتخاب میکند تا قدرت استدلال آن در حل مسائل المپیادی و ریاضی به شکل چشمگیری افزایش یابد. این رویکرد جدید، گامی بزرگ برای هوشمندتر شدن مدلها در محیطهای پیچیده است! 🚀
منبع: arXiv AI
