تا به حال به این فکر کردهاید که چطور مدلهای کوچکتر میتوانند از مدلهای غولآسا یاد بگیرند؟ روشهای فعلی (Distillation) گاهی اوقات اشتباهات مدل معلم را هم یاد میگیرند و دچار خطا میشوند.
محققان در مقاله جدید خود متد RG-OPD را معرفی کردند که با استفاده از «بازخورد تاییدکننده» (Verifier Feedback)، به مدل اجازه میدهد بفهمد چه زمانی باید به خروجی مدل معلم اعتماد کند و چه زمانی نباید! این یعنی مدل دانشآموز میتواند ضمن حفظ دقت، خروجیهای گمراهکننده را فیلتر کند.
نتایج این تحقیق نشان میدهد که این روش در حوزههای کدنویسی و استدلال، عملکرد بسیار بهتری نسبت به روشهای سنتی دارد. اگر به دنیای آموزش مدلهای LLM علاقه دارید، کد این ابزار در گیتهاب منتشر شده است.
منبع: arXiv AI
