محققان در یک پژوهش جدید روی مدلهای زبانی (از جمله سری Qwen)، به تحلیل عملکرد لایههای «شبکه پیشرو» (FFN) پرداختهاند. یافتهها نشان میدهد که این لایهها در فرآیند بازیابی اطلاعات (Retrieval)، صرفاً ذخیرهکننده داده نیستند؛ بلکه نقشهای فعال «تقویتکننده» یا «سرکوبکننده» را ایفا میکنند.
این کشف به ما کمک میکند تا بفهمیم مدلها هنگام پاسخ به سوالات طولانی، چطور اطلاعات را فیلتر یا تقویت میکنند و راه را برای بهبود دقت مدلهای بزرگ زبانی در آینده هموار میکند. 🧠✨
منبع: arXiv Machine Learning
