محققان در مقاله جدیدی، متد کارآمدی به نام FlashEvaluator ارائه دادهاند که تحولی در نحوه ارزیابی کاندیداهای خروجی مدلهای زبانی (LLMs) و سیستمهای توصیهگر ایجاد میکند.
تا امروز، سیستمهای «تولیدکننده-ارزیاب» (G-E) به دلیل ارزیابی مستقل کاندیداها، با افزایش حجم محاسبات هنگام پردازش گزینههای زیاد (K) روبرو بودند. اما FlashEvaluator با استفاده از ایدهای هوشمندانه به نام «QKV-Cache» (مشابه آنچه در مکانیزم توجه مدلهای ترنسفورمر میبینیم)، محاسبات تکراری را حذف کرده و تمام کاندیداها را در یک مرحله (Forward Pass) ارزیابی میکند.
نتیجه؟ کاهش چشمگیر هزینههای محاسباتی و افزایش سرعت در سیستمهایی که نیاز به انتخاب هوشمندانه از میان هزاران گزینه دارند. یک گام بزرگ دیگر برای بهینهتر کردن مدلهای سنگین! 💡⚡️
منبع: arXiv Machine Learning
