🔍 راز درونی ترنسفورمرها؛ چگونه مدل‌ها پاسخ‌های غلط را تشخیص می‌دهند؟

⚠️ هشدار به محققان: چرا دقت مدل‌های شناسایی پهپاد گاهی «واقعی» نیست؟

محققان در مطالعه جدیدی به بررسی «دینامیک چرخشی» در مدل‌های زبانی (LLMs) پرداخته‌اند تا بفهمند این مدل‌ها چطور هنگام مواجهه با پاسخ‌های اشتباه، آن‌ها را پردازش و رد می‌کنند. 🧠

نکته جالب اینجاست که وقتی یک ترنسفورمر (مانند Llama یا Mistral) مجبور می‌شود مسیرهای درست و غلط را همزمان بررسی کند، بردارها در فضای پنهان می‌چرخند و از هم جدا می‌شوند. این تحقیق نشان می‌دهد که مدل‌ها در لایه‌های میانی یک «امضای هندسی» از رد پاسخ غلط ایجاد می‌کنند تا در نهایت به خروجی صحیح برسند.

این یافته‌ها درک ما را از معماری داخلی مدل‌های هوش مصنوعی و نحوه تصمیم‌گیری آن‌ها بسیار عمیق‌تر می‌کند!

منبع: arXiv AI