یکی از چالشهای بزرگ هوش مصنوعی، کندی و هزینه بالای پردازش در پنجرههای متنی طولانی (Long-Context) است. محققان به تازگی روشی به نام «CoSA» معرفی کردهاند که با ترکیب هوشمندانه پروکسی و کرنل، محدودیتهای پردازش را دور میزند.
این روش که نیاز به آموزش مجدد ندارد، با اولویتبندی هوشمند دادهها در حافظه، باعث شده تا:
✅ سرعت محاسبه Attention تا ۵ برابر افزایش یابد.
✅ زمان تولید اولین توکن (TTFT) تا ۲.۵ برابر کمتر شود.
✅ مدلها در متون طولانی (تا ۱۲۸ هزار توکن)، بدون افت دقت، بسیار سریعتر عمل کنند.
این پیشرفت گام بزرگی برای اجرای روان مدلهای قدرتمند روی سختافزارهای محدود است!
سازی
منبع: arXiv NLP
