محققان در یک پژوهش جدید، راهکاری برای حل مشکل «هزینه پردازشی» ترنسفورمرها در متون طولانی ارائه دادهاند. مدلهای قدرتمندی مثل LLaMA و Qwen که معمولاً به دلیل مکانیزم Self-attention در پردازش متنهای خیلی بلند کند میشوند، حالا با این روش جدید که «لینیرسازی» نام دارد، بسیار سریعتر و بهینهتر عمل میکنند.
این تیم با استفاده از تکنیکهایی مثل «Sink Tokens» و مدیریت هوشمند حافظه (Cache Routing)، توانستهاند بدون افت کیفیت و دقت، مدلهای ۳۲ میلیارد پارامتری را به شکلی متحول کنند که در مقایسه با روشهای قبلی، عملکرد بسیار درخشانتری داشته باشند. گامی بزرگ برای رسیدن به هوش مصنوعیهای سریعتر و در دسترستر! 🤖⚡️
منبع: arXiv Machine Learning
