آیا تا به حال فکر کردهاید که چرا مدلهای ترنسفورمر به این خوبی یاد میگیرند؟ محققان در مطالعه جدید خود، پیشآموزش ترنسفورمرها را به صورت یک «جریان سریع-کند» (Fast-Slow Flow) در عمق شبکه مدلسازی کردهاند.
در این پژوهش، وزنهای شبکه به عنوان بخشهای غیرمستقیم مسیر حرکت دادهها بررسی شدهاند. جالبترین نکته اینجاست که مدل، فضای پارامترها را به دو بخش «مرئی» و «نامرئی» تقسیم میکند و پایداری شبکه تعیین میکند که معماری چه کاری میتواند انجام دهد، اما دادهها تصمیم میگیرند که واقعاً چه کاری انجام شود! این دیدگاه ریاضی به ما کمک میکند بفهمیم چطور لایههای عمیق مدلهای زبانی به صورت بهینه با هم تعامل میکنند.
این تحقیق گامی مهم در جهت درک عمیقتر از اصول حاکم بر مدلهای بزرگ زبانی است.
منبع: arXiv AI
