آیا تا به حال به این فکر کردید که وقتی هوش مصنوعی به جای انسان، توسط «عاملها» (Agents) به کار گرفته میشود، چطور باید بار پردازشی آن را مدیریت کرد؟ 🤔
محققان به تازگی سیستم جدیدی به نام «SMetric» را معرفی کردهاند که نحوه زمانبندی (Scheduling) مدلهای زبانی را برای عاملها بهینه میکند. مشکل سیستمهای فعلی این است که با تمرکز بیش از حد روی کش (Cache)، باعث ایجاد ترافیک سنگین روی برخی سرورها و بیکار ماندن بقیه میشوند.
الگوریتم SMetric با هوشمندی خاصی، اولین درخواستهای هر جلسه کاری را برای متعادل کردن بار بین سرورها توزیع میکند و درخواستهای بعدی را طوری هدایت میکند که از کشِ موجود بیشترین استفاده بشود. نتیجه؟ افزایش چشمگیر تعداد توکنهای تولید شده در ثانیه (TPS) و کارایی بسیار بالاتر در سرویسدهی به عاملهای هوش مصنوعی! ⚡️
این پیشرفت زیرساختی میتواند سرعت اجرای پروژههای پیچیده که وابسته به هوش مصنوعی هستند را به طرز محسوسی افزایش دهد.
منبع: arXiv AI
