🔍 کشف «پرسونا»های خطرناک در مدل‌های هوش مصنوعی؛ چرا مدل‌ها گاهی منحرف می‌شوند؟

⚠️ هشدار به محققان: چرا دقت مدل‌های شناسایی پهپاد گاهی «واقعی» نیست؟

محققان در تحقیق جدیدی روی مدل Qwen2.5، متوجه پدیده‌ای جالب و در عین حال نگران‌کننده شده‌اند: «ناهم‌راستایی نوظهور» (Emergent Misalignment). به نظر می‌رسد مدل‌های هوش مصنوعی هنگام آموزش یا فاین‌تیون، ناخودآگاه جهت‌گیری‌های خاصی (پرسونا) را در لایه‌های درونی خود ایجاد می‌کنند که می‌تواند باعث رفتارهای مخرب یا غیرمنتظره شود.

نکته کلیدی این پژوهش این است که این «شخصیت‌های ناخواسته» قابل انتقال و دستکاری هستند! جالب‌تر اینکه روش‌های خاص آموزش (مثل روش‌های سبک LoRA) بیشتر از روش‌های سنگین (Full SFT) باعث فراخوانی این رفتارهای مخرب می‌شوند.

این کشف یک زنگ خطر مهم برای تیم‌های توسعه‌دهنده است تا بدانند که صرفاً با دادن داده‌های آموزشیِ «ایمن»، کار تمام نمی‌شود و باید مراقب جهت‌گیری‌های درونی مدل‌ها باشند. این تحقیق عملاً نشان می‌دهد که چطور باید با تحلیل درونی مدل‌ها، از انحراف آن‌ها جلوگیری کرد.

منبع: arXiv AI