🧠 چرا باورهای انسانی، دقت یادگیری تقویتی (RLHF) را تغییر می‌دهد؟

⚠️ هشدار به محققان: چرا دقت مدل‌های شناسایی پهپاد گاهی «واقعی» نیست؟

تحقیقات جدید در حوزه یادگیری تقویتی با بازخورد انسانی (RLHF) نشان می‌دهد که «باورهای» ما درباره توانایی‌های مدل هوش مصنوعی، به‌شدت بر نحوه امتیازدهی و ترجیحات ما تاثیر می‌گذارد.

این مقاله علمی ثابت کرده که اگر انسان‌ها تصورات غلطی درباره توانایی‌های مدل داشته باشند، این موضوع مستقیماً روی خروجی نهایی مدل اثر منفی می‌گذارد. در واقع، محققان پیشنهاد می‌کنند برای رسیدن به نتایج بهتر، باید شکاف بین «باورِ انسان» و «واقعیتِ توانایی مدل» را به حداقل رساند.

این یافته یک گام بزرگ برای توسعه‌دهندگان AI است تا دستورالعمل‌های آموزشی خود را برای ارزیابان انسانی دقیق‌تر کنند.

منبع: arXiv AI