محققان در یک پژوهش جدید، رویکردی علمی و مبتنی بر «برنامهنویسی خطی آنلاین» (Online Linear Programming) برای مدیریت هوشمند درخواستها در مدلهای زبانی بزرگ (LLM) معرفی کردهاند.
💡 چرا این موضوع مهم است؟
بسیاری از سیستمهای فعلی از روشهای اکتشافی (Heuristics) استفاده میکنند که کنترل دقیقی روی تعادل بین سرعت (Latency) و ظرفیت پردازش (Throughput) ندارند. این روش جدید با استفاده از «پاداشهای تصمیمگیری»، درخواستها را به شکلی مدیریت میکند که ضمن رعایت محدودیتهای حافظه و سختافزاری، بهترین عملکرد را در زمان پاسخدهی (Time-to-First-Token) ارائه دهد.
این پیشرفت علمی ثابت میکند که برای سیستمهای مقیاسبزرگ، دقتِ ریاضی جایگزین بسیار بهتری برای آزمون و خطاست.
سازی
منبع: arXiv AI
