یکی از بزرگترین مشکلات مدلهای هوش مصنوعی، «جعبه سیاه» بودن آنهاست؛ یعنی ما دقیقا نمیدانیم مدل چرا یک تصمیم خاص گرفته است. حالا محققان روش جدیدی به نام Weights to Words معرفی کردهاند که این فرآیند را کاملاً متحول میکند.
این روش نه تنها عوامل موثر بر تصمیمات مدل را شناسایی میکند، بلکه آنها را به زبان ساده (طبیعی) ترجمه کرده و به کاربر اجازه میدهد در لحظه، منطق مدل را بازرسی یا حتی اصلاح کند. این یعنی پایان سردرگمی در تحلیل ترجیحات انسان توسط هوش مصنوعی در حوزههایی مثل انتخاب فیلم، توصیههای اخلاقی و پاسخهای متنی.
آیا بالاخره میتوانیم به مغز مدلهای AI اعتماد کنیم؟
منبع: arXiv AI
