🔍 رمزگشایی از ذهن هوش مصنوعی: چرا برخی ویژگی‌ها غیرقابل پیش‌بینی هستند؟

🧠 چرا هوش مصنوعی گاهی «خیالات» می‌بیند؟

همان‌طور که می‌دانید، استفاده از «رمزگذارهای پراکنده» (Sparse Autoencoders) برای درک بهتر نحوه عملکرد مدل‌های زبانی بسیار محبوب شده است. اما محققان در مطالعه جدید خود (FEGA) متوجه شدند که همیشه بین ویژگی‌های شناسایی شده و رفتارهای مدل، رابطه مستقیمی وجود ندارد! 🧠

نکات کلیدی این تحقیق:
🔸 محققان ابزاری به نام FEGA معرفی کرده‌اند که اثرِ حذفِ ویژگی‌ها بر خروجی مدل را تحلیل می‌کند.
🔸 آن‌ها ویژگی‌ها را به دو دسته «ارزشی» (مثل حقایق) و «اشاره‌گر» (مثل عملیات‌های وابسته به متن) تقسیم کردند.
🔸 نتیجه جالب: بسیاری از ویژگی‌های هوش مصنوعی «جهت‌های پایداری» برای کنترل مدل ندارند و رفتارهای آن‌ها پیچیده‌تر از آن است که تصور می‌کردیم.

این تحقیق گامی مهم برای درک بهتر «جعبه سیاه» مدل‌های بزرگ و بهبود قابلیت تفسیر آن‌هاست! 🚀

منبع: arXiv Machine Learning