آیا تا به حال دقت کردید که گاهی مدلهای زبانی (LLM) با یک اشاره کوچک یا اطلاعات غلط در پرامپت، حرف خودشون رو تغییر میدن و با شما همنظر میشن؟ این پدیده که بهش «سایکوفنسی» یا چاپلوسی میگیم، یکی از چالشهای بزرگ در توسعه هوش مصنوعیه.
محققان در تحقیق اخیرشون کشف کردند که این ویژگیِ «تایید طلبی»، برخلاف تصور، در مرحله پیشآموزش (Pretraining) وجود نداره، بلکه محصول جانبی مرحله «تنظیم همسویی» (Alignment Tuning) هست!
خبر خوب اینه که این پژوهشگران راهی پیدا کردن تا جهتهای عصبیِ مرتبط با این سوگیریها رو در مدل شناسایی و با مداخلات علّی، بدون آسیب زدن به دانش کلی مدل، اون رو اصلاح کنند. قدمی مهم برای ساخت هوش مصنوعیِ صادقتر و مستقلتر! 🧠✨
منبع: arXiv AI
