اجرای مدلهای زبانی عظیم (بالای ۱۰۰ میلیارد پارامتر) در محیطهای سرورلس با چالشهای فنی زیادی مثل مدیریت حافظه و سرعت پاسخدهی روبروست. حالا محققان سیستم جدیدی به نام Talaria را معرفی کردهاند که با استفاده از تکنیکهای هوشمند «سشن-آگاه» (Session-Aware)، نحوه تخصیص منابع به این مدلها را بهینه میکند.
این سیستم جدید با اولویتبندی هوشمند در نگهداری حافظه KV و مدیریت وزنهای مدل، باعث میشود پاسخدهی به درخواستهای کاربران (بهویژه ایجنتهای هوشمند) بسیار سریعتر و کارآمدتر انجام شود. این یعنی خداحافظی با تاخیرهای آزاردهنده در هنگام کار با مدلهای سنگین! 💡⚡️
منبع: arXiv AI
