حتماً شنیدهاید که برخی نسخههای «بدون سانسور» مدلهای هوش مصنوعی با تکنیکی به نام Abliteration (حذف جهتگیریهای امتناع) ساخته میشوند. اما پژوهش جدیدی نشان میدهد که این جراحی روی مدلها چندان هم تمیز نیست! 🔪
محققان با بررسی تأثیر این دستکاری بر تصمیمگیریهای مالی (پیشبینی بازار بورس)، متوجه شدند که حذف قفلهای مدل باعث بروز رفتارهای جانبی عجیبی میشود:
✅ خوشبینی افراطی: مدلهای «آزاد شده» تمایل دارند به شکل سیستماتیک خوشبینتر از مدلهای پایه عمل کنند.
✅ تغییر در اعتماد به نفس: این جراحی میتواند در مدلهای مختلف، تأثیرات کاملاً متضادی روی اعتماد به نفس مدل در ارائه پاسخها داشته باشد.
✅ پرگویی در توجیه: این مدلها تمایل دارند برای پاسخهای خود طولانیتر و مفصلتر استدلال کنند.
خلاصه اینکه دست بردن در هسته مدلها فقط باعث «آزاد شدن» آنها نمیشود، بلکه ذهنیت و نحوه استدلالشان را هم ناخواسته تغییر میدهد. این یافته برای کسانی که از مدلهای دستکاری شده استفاده میکنند، نکته مهمی است! 🧠💡
منبع: arXiv Machine Learning
