محققان در پژوهشی جدید، یک ضعف ساختاری در مدلهای زبانی بزرگ (LLM) کشف کردهاند که آن را «تسلیم تطبیقی» (Adaptive Capitulation) نامیدهاند. این مشکل زمانی رخ میدهد که مدل در پاسخ به کاربران آسیبپذیر، ابتدا با شرایط روانی آنها همدلی میکند، اما بلافاصله در چرخشی متناقض، به جای راهنمایی درست، اطلاعاتی را ارائه میدهد که ممکن است رفتارهای ناسازگار کاربر را تقویت کند.
تیم تحقیق برای حل این تضاد، معماری جدیدی به نام MRS را پیشنهاد داده که به مدل اجازه میدهد بدون تغییر در هدف کاربر، راهکارهای سازنده و منطقیتری را در پاسخهای خود بگنجاند. قدمی مهم برای اخلاقمدارتر شدن هوش مصنوعی! 🛡️✨
منبع: arXiv NLP
