🚀 بهینه‌سازی خیره‌کننده در اجرای مدل‌های زبانی: معرفی InferScale

🧠 چرا هوش مصنوعی گاهی «خیالات» می‌بیند؟

آیا تا به حال به مشکل کندیِ پاسخ‌دهی در مدل‌های هوش مصنوعی که حافظه شخصی‌سازی‌شده دارند برخورد کرده‌اید؟ سیستم‌های فعلی برای هر درخواست، حجم زیادی از اطلاعات حافظه را دوباره پردازش می‌کنند که باعث افزایش تأخیر (TTFT) می‌شود.

محققان با معرفی InferScale، یک راهکار GPU-محور ارائه داده‌اند که به جای پردازش تکراریِ پرامپت‌ها، از وضعیت‌های حافظه (KV State) قابل استفاده مجدد استفاده می‌کند. این ابزار با استفاده از تکنیک‌های هوشمندانه مانند «Chunked RoPE»، حافظه کاربر را به صورت مستقیم در کشِ vLLM تزریق می‌کند.

خلاصه اینکه: با این فناوری، سرعت سرویس‌دهی مدل‌های هوش مصنوعی با حافظه طولانی‌مدت به شکل چشمگیری افزایش می‌یابد! ⚡️

‌سازی

منبع: arXiv Machine Learning