تا به حال فکر کردید که چرا برخی از مدلهای هوش مصنوعی بعد از آموزش با دادههای انسانی (RLHF)، گاهی نتایج متناقض یا偏گیرانهای ارائه میدهند؟
محققان در پژوهش جدیدی به موضوع جالبی اشاره کردهاند: «سوگیری ناشی از وضعیت روانی ارزیابان»! 🧠
این مطالعه نشان میدهد که وقتی ارزیابانِ انسانی خسته یا تحت فشار باشند، قضاوتهای آنها فقط بازتاب کیفیتِ پاسخ هوش مصنوعی نیست، بلکه بازتابی از «وضعیت روانیِ خودِ آنها» هم هست. این سوگیریهای ساختاریافته میتواند به مدلهای یادگیری تقویتشده منتقل شده و در مدل نهایی باقی بماند.
این مقاله علاوه بر کشف این چالش، یک چارچوب جدید برای «حسابرسی و شناسایی» این نوع سوگیریها پیشنهاد داده است تا گامی مهم برای توسعه مدلهای منصفانهتر برداشته شود.
منبع: arXiv AI
