محققان در پژوهش جدید خود به کشف جالبی درباره ترنسفورمرها رسیدهاند! آنها متوجه شدند که وقتی مدلها سعی میکنند متنهای بسیار طولانی را پردازش کنند، «وابستگیهای محلی متراکم» باعث ایجاد پدیدهای به نام «انفجار لاجیتها» (Attention-Logit Explosion) میشود.
این مشکل نه تنها باعث ناپایداری در آموزش مدل میشود، بلکه بهویژه در محاسبات با دقت پایین (Low-precision)، کیفیت خروجی را بهشدت کاهش میدهد. این مقاله پیشنهاد میدهد که با مدلسازی دقیقتر این وابستگیهای محلی، میتوانیم معماریهای آینده را برای متنهای طولانی بسیار پایدارتر و کارآمدتر کنیم. خبر خوبی برای توسعهدهندگان مدلهای زبانی بزرگ که به دنبال کانتکستهای طولانیتر هستند! 🚀
منبع: arXiv Machine Learning
