محققان در مقاله جدیدی روشی خلاقانه ابداع کردهاند که در آن با استفاده از تکنیکهای کلاسیک فشردهسازی داده (مثل Gzip)، لایههای توجه در مدلهای ترنسفورمر را بدون نیاز به هیچ پارامتر اضافی یا محاسبات پیچیده، بهینه میکنند. 📉
این روش که «Adaptive Sparse Attention» نام دارد، به مدل اجازه میدهد بهطور خودکار بخشهای مهم متن را تشخیص دهد و از پردازشهای اضافه روی بخشهای کماهمیت جلوگیری کند. نتیجه این کار چیست؟
✅ عملکرد بهتر از مدلهای سنگینی مثل Longformer و BigBird
✅ سرعت همگرایی ۳.۳ برابر بیشتر
✅ مدیریت عالی متنهای طولانی (Context 8K)
این یعنی در آینده میتوانیم مدلهای بسیار هوشمندتر اما سبکتری داشته باشیم که برای یادگیری یا استنتاج، انرژی و منابع محاسباتی کمتری مصرف میکنند! 🧠✨
منبع: arXiv Machine Learning
