یکی از بزرگترین چالشهای هوش مصنوعی در متون طولانی، کند شدن مدل به خاطر محدودیت حافظه (KV Cache) است. محققان به تازگی روشی به نام «GLIDE» را معرفی کردهاند که با ترکیب هوشمندانه توجه نرم (Softmax) و روشهای تکرار شونده خطی، این گلوگاه را از بین میبرد.
نکته جالب اینجاست که GLIDE لایههای مدل را متمایز میکند؛ در لایههای ابتدایی دقت را حفظ کرده و در لایههای عمیقتر از جایگزینهای سریعتر استفاده میکند. نتیجه؟ سرعت بالاتر و تأخیر کمتر در تولید پاسخ، بدون اینکه کیفیت خروجی فدا شود! این یعنی تجربهای روانتر در کار با مدلهای زبانی عظیم. 🤖⚡️
منبع: arXiv AI
