محققان به تازگی سیستم جدیدی به نام «Gubernaut» طراحی کردهاند که مثل یک لایه نظارتی، از رفتارهای نامطلوب مدلهای زبانی بزرگ (مثل لجبازی، چاپلوسی یا درجا زدن) جلوگیری میکند. 🛑
نکته جالب اینجاست که این سیستم بدون خواندن متن، فقط با تحلیل اعداد و «تلهمتری» خروجیهای مدل، یک وضعیت رفتاریِ منطقی برای آن تعیین میکند. تستهای انجام شده روی مدلهای پیشرویی مثل GPT-5.5 و Claude 4.8 نشان داده که این روش باعث افزایش ثبات و تعادل رفتاری در ایجنتهای هوش مصنوعی میشود. گامی مهم برای ایمنتر کردن و کنترل دقیقتر مدلهای پرقدرت! 🧠✨
منبع: arXiv NLP
