یکی از بزرگترین چالشهای اجرای مدلهای زبانی بزرگ (LLM) روی گوشیها و سختافزارهای ضعیفتر، پیشبینی دقیق سرعت پاسخدهی (Latency) است که به شدت به نوع دستگاه و شرایط دمایی بستگی دارد.
به تازگی مقالهای منتشر شده که یک چارچوب جدید برای پیشبینی دقیقتر زمان اجرای مدلها معرفی میکند. این ابزار با ترکیب دادههای سختافزاری و مدلهای پیشبینی، دقت اندازهگیری را در دستگاههایی مثل «پیکسل ۸» به طرز چشمگیری بالا برده است. این یعنی در آینده نزدیک، اپلیکیشنهای هوش مصنوعی روی گوشیهای ما بهینهتر و سریعتر اجرا خواهند شد.
این تحقیق نشان میدهد که سختافزارهای مختلف رفتارهای بسیار متفاوتی دارند و مدیریت هوشمند این تفاوتها، کلید اصلی توسعه اپلیکیشنهای کارآمد است. 📱🤖
منبع: arXiv AI
