یکی از بزرگترین چالشهای فعلی در آموزش مدلهای زبانی (RLHF)، تناقض و سلیقهای بودن نظرات انسانی است. وقتی انسانها در ارزیابی یک پاسخ با هم اختلاف نظر دارند، مدل گیج میشود و عملکردش افت میکند.
محققان به تازگی فریمورک جدیدی به نام «RGPO» (Reliability-Guided Preference Optimization) معرفی کردهاند که با شناسایی میزان اعتبار نظرات انسانی، به مدل کمک میکند فقط روی پاسخهای «قابل اعتماد» تمرکز کند. این یعنی حذف نویز و رسیدن به نتایج بسیار دقیقتر و منطقیتر در چتباتهای آینده. 🔥
این روش نشان میدهد که کیفیت دادههای آموزشی، حتی از خودِ حجمِ داده هم مهمتر است.
منبع: arXiv AI
