🔍 رمزگشایی از ذهن هوش مصنوعی: روش جدید برای استخراج ویژگی‌های استدلالی

⚠️ هشدار به محققان: چرا دقت مدل‌های شناسایی پهپاد گاهی «واقعی» نیست؟

محققان در یک پژوهش جدید، چارچوب نوآورانه‌ای به نام «MAG» (معدن‌کاری از طریق هندسه فعال‌سازی) معرفی کرده‌اند که بدون نیاز به داده‌های برچسب‌دار، به ما کمک می‌کند بفهمیم مدل‌های زبانی (LLM) چطور استدلال می‌کنند.

با این روش، می‌توان ویژگی‌های ذهنی مدل را مستقیماً از فعالیت‌های درونی آن استخراج کرد. جالب‌تر اینکه محققان توانستند با استفاده از این تکنیک، رفتارهای مدل را تغییر دهند یا عملکرد آن را در تشخیص‌های خاص بهبود ببخشند. این قدم بزرگی برای تبدیل «جعبه سیاه» مدل‌های زبانی به سیستمی شفاف و قابل کنترل است. 🧠💡

منبع: arXiv AI