تحقیقات جدید در حوزه یادگیری تقویتی با بازخورد انسانی (RLHF) نشان میدهد که «باورهای» ما درباره تواناییهای مدل هوش مصنوعی، بهشدت بر نحوه امتیازدهی و ترجیحات ما تاثیر میگذارد.
این مقاله علمی ثابت کرده که اگر انسانها تصورات غلطی درباره تواناییهای مدل داشته باشند، این موضوع مستقیماً روی خروجی نهایی مدل اثر منفی میگذارد. در واقع، محققان پیشنهاد میکنند برای رسیدن به نتایج بهتر، باید شکاف بین «باورِ انسان» و «واقعیتِ توانایی مدل» را به حداقل رساند.
این یافته یک گام بزرگ برای توسعهدهندگان AI است تا دستورالعملهای آموزشی خود را برای ارزیابان انسانی دقیقتر کنند.
منبع: arXiv AI
