محققان روش نوآورانهای را برای بهبود فرآیند «یادگیری تقویتی از بازخورد انسانی» (RLHF) معرفی کردهاند. در این متد جدید که «DPO-PoP» نام دارد، به جای تکیه بر امتیازات عددی ساده، از «ترجیحات روی ترجیحات» استفاده میشود.
این یعنی مدل یاد میگیرد که تشخیص دهد کدام ترجیح انسان، اولویت و قوت بیشتری دارد. این رویکرد به هوش مصنوعی کمک میکند تا حاشیه (Margin) یادگیری را به صورت پویا تنظیم کرده و در نهایت خروجیهای دقیقتر و هوشمندتر تولید کند. گامی مهم برای افزایش دقت مدلهای زبانی در درک ظرافتهای انسانی! 🚀
منبع: arXiv AI
