یک تحقیق جدید و جذاب در arXiv منتشر شده که به بررسی ساختار مدلهای «Attention-only» (مدلهای ترنسفورمر بدون لایههای Feed-forward) پرداخته است. نتایج این مطالعه نشان میدهد که اگر بودجه محاسباتی را بهدرستی بازتوزیع کنیم، میتوانیم مدلهایی بسازیم که عملکردی بسیار نزدیک به ترنسفورمرهای استاندارد داشته باشند.
نکات کلیدی این پژوهش:
🔹 جایگزینی لایههای Feed-forward با عمق بیشتر در بخش Attention، فاصله کارایی را به حداقل میرساند.
🔹 این مدلها در درک زمینههای متنی (context-grounded) عالی هستند، اما در فراخوانی دانش از وزنها (parametric recall) ضعیفتر عمل میکنند.
🔹 روش QK-normalization نقش کلیدی در آموزش پایدار این مدلهای سادهسازی شده ایفا میکند.
این مقاله برای کسانی که به دنبال بهینهسازی معماریهای هوش مصنوعی و درک عمیقتر از نحوه یادگیری مدلها هستند، یک مطالعه الزامی است!
منبع: arXiv AI
