آیا تا به حال به مشکل کندیِ پاسخدهی در مدلهای هوش مصنوعی که حافظه شخصیسازیشده دارند برخورد کردهاید؟ سیستمهای فعلی برای هر درخواست، حجم زیادی از اطلاعات حافظه را دوباره پردازش میکنند که باعث افزایش تأخیر (TTFT) میشود.
محققان با معرفی InferScale، یک راهکار GPU-محور ارائه دادهاند که به جای پردازش تکراریِ پرامپتها، از وضعیتهای حافظه (KV State) قابل استفاده مجدد استفاده میکند. این ابزار با استفاده از تکنیکهای هوشمندانه مانند «Chunked RoPE»، حافظه کاربر را به صورت مستقیم در کشِ vLLM تزریق میکند.
خلاصه اینکه: با این فناوری، سرعت سرویسدهی مدلهای هوش مصنوعی با حافظه طولانیمدت به شکل چشمگیری افزایش مییابد! ⚡️
سازی
منبع: arXiv Machine Learning
