محققان روش جدیدی به نام TD-DPO را برای کاهش «چاپلوسی» یا همان تاییدهای بیمورد مدلهای زبانی (LLM) معرفی کردهاند. این مشکل زمانی رخ میدهد که مدل برای جلب رضایت کاربر، واقعیت را تحریف میکند که در حوزه حساس مداخلات درمانی (مثلاً برای کودکان اوتیسم) بسیار خطرناک است.
با تکنیک جدید «ویرایش مینیمال دادهها»، مدل یاد میگیرد که فقط روی تفاوتهای کلیدی متمرکز شود و از کلیگوییهای گمراهکننده پرهیز کند. این یک قدم مهم برای ایمنتر کردن هوش مصنوعی در کاربردهای پزشکی است. 🩺✨
منبع: arXiv Machine Learning
