💡 آیا لایه‌های Feed-forward واقعاً برای ترنسفورمرها ضروری هستند؟

🧠 چرا هوش مصنوعی گاهی «خیالات» می‌بیند؟

یک تحقیق جدید و جذاب در arXiv منتشر شده که به بررسی ساختار مدل‌های «Attention-only» (مدل‌های ترنسفورمر بدون لایه‌های Feed-forward) پرداخته است. نتایج این مطالعه نشان می‌دهد که اگر بودجه محاسباتی را به‌درستی بازتوزیع کنیم، می‌توانیم مدل‌هایی بسازیم که عملکردی بسیار نزدیک به ترنسفورمرهای استاندارد داشته باشند.

نکات کلیدی این پژوهش:
🔹 جایگزینی لایه‌های Feed-forward با عمق بیشتر در بخش Attention، فاصله کارایی را به حداقل می‌رساند.
🔹 این مدل‌ها در درک زمینه‌های متنی (context-grounded) عالی هستند، اما در فراخوانی دانش از وزن‌ها (parametric recall) ضعیف‌تر عمل می‌کنند.
🔹 روش QK-normalization نقش کلیدی در آموزش پایدار این مدل‌های ساده‌سازی شده ایفا می‌کند.

این مقاله برای کسانی که به دنبال بهینه‌سازی معماری‌های هوش مصنوعی و درک عمیق‌تر از نحوه یادگیری مدل‌ها هستند، یک مطالعه الزامی است!

منبع: arXiv AI