🚀 افزایش سرعت خیره‌کننده در مدل‌های زبانی با تکنیک CoSA!

🧠 چرا هوش مصنوعی گاهی «خیالات» می‌بیند؟

یکی از چالش‌های بزرگ هوش مصنوعی، کندی و هزینه بالای پردازش در پنجره‌های متنی طولانی (Long-Context) است. محققان به تازگی روشی به نام «CoSA» معرفی کرده‌اند که با ترکیب هوشمندانه پروکسی و کرنل، محدودیت‌های پردازش را دور می‌زند.

این روش که نیاز به آموزش مجدد ندارد، با اولویت‌بندی هوشمند داده‌ها در حافظه، باعث شده تا:
✅ سرعت محاسبه Attention تا ۵ برابر افزایش یابد.
✅ زمان تولید اولین توکن (TTFT) تا ۲.۵ برابر کمتر شود.
✅ مدل‌ها در متون طولانی (تا ۱۲۸ هزار توکن)، بدون افت دقت، بسیار سریع‌تر عمل کنند.

این پیشرفت گام بزرگی برای اجرای روان مدل‌های قدرتمند روی سخت‌افزارهای محدود است!

‌سازی

منبع: arXiv NLP