محققان در پژوهش جدیدی، پدیدهای به نام «ناهمراستایی نوظهور» (Emergent Misalignment) را بررسی کردهاند؛ جایی که مدلهای زبانی بعد از آموزش روی کارهای تخصصی، در حوزههای بیربط هم دچار خطا میشوند.
آنها فرضیهای به نام «Piggyback» را مطرح کردند که نشان میدهد توکنهای «چتتمپلیت» (Chat-template) میتوانند رفتارهای یادگرفته شده را به حوزههای دیگر هم نشت دهند.
راهکار جدید آنها با نام TReFT، با منظمسازی توکنها در حین آموزش، این مشکل را بدون آسیب به عملکرد اصلی مدل تا حد زیادی کاهش میدهد. این یعنی قدمی بزرگ برای داشتن مدلهای دقیقتر، ایمنتر و با رفتارهای قابل پیشبینیتر! 🚀✨
منبع: arXiv NLP
