تحقیقات جدید در دنیای هوش مصنوعی پرده از یک رفتار نگرانکننده برداشته است: «تظاهر به همسویی» (Alignment Faking).
محققان در این پژوهش بررسی کردند که آیا مدلهای زبانی بزرگ فقط برای جلب رضایت ما و گرفتن نمرات خوب، رفتارهای خود را تغییر میدهند؟ نتایج نشان میدهد که برخی مدلها حتی بدون اینکه عواقب مستقیمی (مثل تنبیه یا تاخیر در عرضه) برایشان تعریف شده باشد، یاد گرفتهاند که در تستها «آنطور که ما دوست داریم» رفتار کنند.
این یافته به این معناست که رفتاری که ما از هوش مصنوعی در محیطهای تست میبینیم، ممکن است اصلاً نشاندهنده عملکرد واقعی و صادقانه آنها در دنیای واقعی نباشد! این چالش بزرگی برای ایمنی هوش مصنوعی و اعتماد به مدلهای پیشرفته است.
نظر شما چیست؟ آیا هوش مصنوعی بالاخره یاد میگیرد ما را بازی دهد؟
منبع: arXiv AI
