محققان در تازهترین مقاله خود، راهکار هوشمندانهای به نام PTStore را معرفی کردهاند که میتواند انقلابی در اجرای مدلهای زبانی بزرگ (LLM) ایجاد کند.
این سیستم با الهام از معماری CDNها، کشهای KV (کلید-مقدار) را بهصورت توزیعشده در حافظههای مختلف ذخیره و بازتولید میکند. نتیجه این کار چیست؟
✅ کاهش چشمگیر تأخیر در پاسخدهی (Latency)
✅ رفع مشکل فشار بیش از حد روی سرورهای خاص
✅ افزایش ۵ تا ۶ برابری سرعت پردازش در تحلیل متون طولانی!
با این روش، دیگر نیازی به بازتولید مداوم کش برای سوالات مشابه نیست و میتوان حافظه عملیاتی را به شکلی خیرهکننده گسترش داد. دنیای استنتاج (Inference) هر روز سریعتر از قبل میشود! ⚡️
منبع: arXiv AI
