محققان به تازگی بنچمارک جدیدی به نام «InferenceBench» را معرفی کردهاند که به دنبال ارزیابی توانایی «عاملهای هوش مصنوعی» (AI Agents) در بهینهسازی سرعتِ استنتاج (Inference) مدلهای زبانی است.
در این چالش، عاملهای هوش مصنوعی باید بتوانند در یک بازه زمانی مشخص و با استفاده از یک GPU، سرور استنتاج را طوری تنظیم کنند که سرعت پردازش مدل به حداکثر برسد. نتایج نشان میدهد که این عاملها در حال حاضر میتوانند تا ۸ برابر از روشهای سنتی بهتر عمل کنند، هرچند هنوز هم برای رسیدن به ایدهآلترین تنظیمات، جای کار دارند.
این ابزار کمک بزرگی برای توسعهدهندگانی است که به دنبال افزایش بهرهوری و کاهش هزینههای اجرای مدلهای بزرگ (LLMs) هستند. 🤖⚙️
سازی
منبع: arXiv AI
