🔍 رازهای درونی مدل‌های زبانی: لایه‌های FFN چگونه یاد می‌گیرند؟

⚠️ هشدار به محققان: چرا دقت مدل‌های شناسایی پهپاد گاهی «واقعی» نیست؟

محققان در یک پژوهش جدید روی مدل‌های زبانی (از جمله سری Qwen)، به تحلیل عملکرد لایه‌های «شبکه پیش‌رو» (FFN) پرداخته‌اند. یافته‌ها نشان می‌دهد که این لایه‌ها در فرآیند بازیابی اطلاعات (Retrieval)، صرفاً ذخیره‌کننده داده نیستند؛ بلکه نقش‌های فعال «تقویت‌کننده» یا «سرکوب‌کننده» را ایفا می‌کنند.

این کشف به ما کمک می‌کند تا بفهمیم مدل‌ها هنگام پاسخ به سوالات طولانی، چطور اطلاعات را فیلتر یا تقویت می‌کنند و راه را برای بهبود دقت مدل‌های بزرگ زبانی در آینده هموار می‌کند. 🧠✨

منبع: arXiv Machine Learning