محققان در یک پیشرفت هیجانانگیز، معماری جدیدی به نام «T^2MLR» را معرفی کردهاند که مشکل بزرگ ترنسفورمرها در پردازشهای متوالی و طولانیمدت را حل میکند. این مدل با استفاده از قابلیت «بازگشت میانی» (Middle-Layer Recurrence)، اجازه میدهد تا اطلاعاتِ انتزاعی و مهم، بدون نیاز به محاسبات سنگین، بین مراحل مختلفِ استدلال حفظ شوند.
نکته جالب اینجاست که این معماری نه تنها عملکرد مدلهای زبانی را در حل مسائل ریاضی و استدلالی بهشدت بهبود میبخشد، بلکه برای اعمال آن روی مدلهای فعلی، نیازی به آموزش از صفر نیست! این یعنی راه برای مدلهای کوچکتر اما بسیار باهوشتر هموارتر شد. 📈🔥
منبع: arXiv NLP
