همتراز کردن مدلهای زبانی (Alignment) همیشه یکی از چالشهای بزرگ بوده است. معمولاً برای این کار به بازخورد انسانی یا پاداشهای پیچیده نیاز داریم، اما محققان در یک پژوهش جدید، متد نوآورانهای به نام «PARED» معرفی کردهاند.
این روش از تکنیک «یادگیری تقویتی معکوس» (Inverse RL) استفاده میکند. در واقع PARED میتواند «پاداشهای ضمنی» را از رفتارها و نمایشهای انسانی استخراج کند و بدون نیاز به ترجیحات انسانیِ پرهزینه، مدل را به صورت خودکار بهبود ببخشد. این یعنی مدلها میتوانند با تماشای نحوه عملکرد متخصصان، به شکلی بهینهتر و بدون نیاز به یادگیری نظارتشدهی سنگین، همتراز (Align) شوند.
این پیشرفت میتواند مسیر را برای ساخت هوش مصنوعیِ امنتر و هوشمندتر، بسیار هموارتر کند. 🚀
منبع: arXiv Machine Learning
