یکی از چالشهای اصلی آموزش مدلهای زبانی، ضعف در نظارت دقیق بر پاسخهای مدل در مراحل نهایی است. حالا محققان چارچوب نوآورانهای به نام «DynamicRubric» معرفی کردهاند که با ایجاد یک سیستم ارزیابی پویا، کیفیت آموزش مدلها را بهطور چشمگیری بهبود میبخشد.
نکته جذاب اینجاست که این روش نه تنها روی مدلهای ۸ میلیاردی عملکردی بهتر از مدلهای بسیار بزرگتر داشته، بلکه هماکنون در سیستم پاسخگویی هوشمند «ویچت» نیز برای میلیونها درخواست روزانه به کار گرفته شده است. این یعنی یک گام عملی و بزرگ برای استدلال دقیقتر و کدنویسی بهتر در هوش مصنوعی! 🤖💡
منبع: arXiv Machine Learning
