اگر با دنیای مدلهای زبانی بزرگ (LLM) و اجرای آنها روی سیستمهای خودتان (Local Inference) سر و کار دارید، حتماً نام «vLLM» به گوشتان خورده است. اما آیا میدانستید تنظیمات مختلف این موتور چقدر روی مصرف انرژی، سرعت و حتی دقت مدل شما تأثیر میگذارد؟
پژوهشگران در یک بررسی بزرگ و فنی، بیش از ۹۰۰۰ بار اجرای مدلهای مختلف را تحلیل کردهاند تا ببینند پارامترهایی مثل «attention kernel» و «prefix caching» چه تأثیری روی خروجی دارند. نتیجه؟ هیچ تنظیمات «جادویی» برای همه وجود ندارد و هنر شما در تنظیم کردن این پارامترهاست تا به بهترین بهرهوری (Pareto frontier) برسید.
اگر در حال توسعه پروژههای سنگین هوش مصنوعی هستید، این مطالعه نقشه راه خوبی برای کاهش هزینهها و افزایش سرعت اجراست!
سازی
منبع: arXiv AI
