مدلهای زبانی بزرگ برای همراستا شدن با نیازهای انسانی از روش DPO استفاده میکنند، اما مشکل اصلی اینجاست که دادههای دارای نویز و اشتباه، عملکرد مدل را به شدت پایین میآورند.
محققان به تازگی متد جدیدی معرفی کردهاند که بدون نیاز به متادیتای پیچیده، یاد میگیرد دادههای آموزشی را وزندهی مجدد کند تا نویزها حذف شوند. با استفاده از این روش، حتی در شرایطی که دادههای باکیفیت در دسترس نیستند، مدل میتواند بسیار دقیقتر و ایمنتر عمل کند. این نوآوری به خصوص در حوزههای خلاصهسازی و گفتوگوهای هوشمند، قدم بزرگی برای افزایش دقت مدلهای آینده است. 🤖✨
منبع: arXiv Machine Learning
