تا به حال دقت کردید که مدلهای زبانی (LLMs) چقدر سریع و بیحوصله جواب نهایی رو کف دست دانشآموز میذارن؟ این دقیقاً برخلاف روش «آموزش سقراطی» است که در اون دانشآموز با پرسشهای هدایتگر به جواب میرسه.
محققان در مقاله جدیدی، مدل HeuristicEdu رو معرفی کردن که با استفاده از تکنیک یادگیری تقویتی (GRPO)، مدل Qwen2.5 رو آموزش داده تا مثل یک معلم حرفهای، به جای لو دادن پاسخ، دانشآموز رو به چالش بکشه و تفکر عمیق رو در اون پرورش بده.
نتایج نشون میده که این مدل جدید تونسته نرخ «لو رفتن پاسخ» رو به شدت کاهش بده و سطح درگیری ذهنی دانشآموز رو بالا ببره. به نظر میرسه آینده آموزش دیجیتال، داشتنِ دستیارهایی است که صبرِ معلمی دارن! ✨
منبع: arXiv NLP



