یکی از چالشهای اصلی در دنیای هوش مصنوعی، تنظیم دقیق مدلهای زبانی (LLMs) با ترجیحات انسانی است که معمولاً به دلیل کمبود دادههای باکیفیت کار دشواری است. حالا محققان فریمورک جدیدی به نام «RM-Distiller» معرفی کردهاند که به جای استفاده ساده از مدلهای معلم به عنوان برچسبزن، از تمام ظرفیتهای آنها استفاده میکند.
این روش جدید با بهرهگیری از توانمندیهای «تولید»، «ارزیابی» و «اصلاح» مدلهای معلم، باعث میشود مدلهای پاداش (Reward Models) بسیار دقیقتر و هوشمندتر عمل کنند. این اولین پژوهش سیستماتیک در این حوزه است که میتواند مسیر آموزش مدلهای هوش مصنوعی را به کلی تغییر دهد. 🧠✨
منبع: arXiv NLP
