همانطور که میدانید، اجرای برنامههای پیچیده توسط مدلهای زبانی بزرگ (LLM) هزینه و زمان زیادی میبرد. محققان به تازگی فریمورک «MiniCache» را معرفی کردهاند که با استفاده از مدلهای کوچک به عنوان یک لایه واسط، خروجیهای برنامهنویسیشده را ذخیره و دوباره استفاده میکند.
نتایج این تحقیق نشان میدهد که استفاده از MiniCache میتواند تا ۳.۱ برابر تأخیر را کاهش و throughput (نرخ پردازش) را تا ۲.۸ برابر افزایش دهد، بدون اینکه کیفیت پاسخها افت کند. این یعنی گامی بزرگ به سوی مدلهای زبانی سریعتر و مقرونبهصرفهتر برای کارهای تخصصی!
سازی
منبع: arXiv AI
