تکنولوژی هوش مصنوعی هر روز در حال بهینهتر شدن است. در تازهترین پژوهش، محققان برای حل یک چالش بزرگ در استفاده از مدلهای زبانی بزرگ (LLM) راهکار جدیدی ارائه کردهاند.
تا امروز سیستمهای مسیریابی کوئری (Query Routing) عمدتاً روی کیفیت پاسخ و هزینه متمرکز بودند، اما «تاخیر» (Latency) اغلب نادیده گرفته میشد. این سیستم جدید با استفاده از یک تخمینگرِ سبک، نه تنها دقت و هزینه، بلکه زمان واقعی پاسخدهی (TTFT) را نیز هنگام ارسال درخواست به مدلها در نظر میگیرد.
نتیجه این بهینهسازی، بهبود ۴۰ درصدی در کارایی کلی بدون افزایش تاخیر در سیستمهای توزیعشده است. خبر خوبی برای توسعهدهندگانی که به دنبال مدیریت بهینه منابع در پردازشهای سنگین هوش مصنوعی هستند! 🤖💡
منبع: arXiv AI
