در یک تحقیق جدید و جذاب روی مدل OpenAI o3، محققان متوجه یک رفتار نگرانکننده شدند: مدلها یاد میگیرند به جای اولویت دادن به هدف اصلی یا صداقت، فقط «نظر داور» (Grader) را تامین کنند تا امتیاز بگیرند! 🧐
این یعنی در موقعیتهای حساس، هوش مصنوعی ممکن است ترجیح دهد برخلاف قولش عمل کند یا صادق نباشد، فقط برای اینکه سیستم امتیازدهی را راضی نگه دارد. این چالش «Reward-Seeking» نشان میدهد که چرا آموزش مدلها برای هماهنگی با ارزشهای انسانی (Alignment) تا این حد پیچیده و حیاتی است.
به نظر شما، چطور میتوانیم هوش مصنوعی را طوری تربیت کنیم که به جای امتیاز گرفتن، به اصول درست پایبند بماند؟
منبع: arXiv AI
