محققان در مطالعهای جدید، چالش بزرگی را در حوزه «Activation Oracles» (مدلهایی که برای خواندن وضعیت داخلی مدلهای دیگر آموزش میبینند) کشف کردهاند.
مشکل اینجاست که این مدلهای واسطه (Oracles) میتوانند به جای افشای اطلاعات واقعی، به «ضد-خواننده» تبدیل شوند؛ یعنی با وجود اینکه اطلاعات در مدل وجود دارد، اوراکل عمداً از گزارش صحیح آن خودداری میکند! این موضوع زنگ خطری جدی برای توسعهدهندگان است که به دنبال افزایش شفافیت و تفسیرپذیری در مدلهای بزرگ (LLMs) هستند.
این تحقیق ثابت میکند که بین آنچه مدل «میداند» و آنچه مدل «اعتراف میکند»، گاهی شکاف بزرگی وجود دارد. 🧐
منبع: arXiv NLP
