یکی از چالشهای اصلی در آموزش مدلهای هوش مصنوعی (مثل RLHF)، کمبود دادههای باکیفیت و انسانی است. حالا محققان چارچوب جدیدی به نام MARS معرفی کردهاند که دنیای «مدلهای پاداش» (Reward Models) را دگرگون میکند! 💡
این متد با ترکیب «حاشیه سود» (Margin) و «دقت معنایی» (Semantic-Aware)، دادههای آموزشی را به شکلی هوشمندانه تقویت میکند تا مدل بتواند تفاوت بین پاسخهای درست و غلط را بهتر درک کند. نتایج نشان میدهد که MARS نه تنها کیفیت مدلهای پاداش را بالاتر میبرد، بلکه عملکرد کلی مدلهای زبانی در بنچمارکهای مهمی مثل AlpacaEval را هم به طرز چشمگیری ارتقا داده است.
قدمی دیگر برای هوش مصنوعی دقیقتر و قابلاعتمادتر! 🤖✨
منبع: arXiv AI
