یکی از بزرگترین چالشهای استفاده از مدلهای زبانی بزرگ (LLM)، مصرف رم بالا و سنگین بودن اونهاست که اجرای اونها رو روی گوشیها و دستگاههای لبه (Edge Devices) سخت میکنه.
حالا محققان روشی به اسم SelectInfer معرفی کردن که مثل یک متخصص عمل میکنه! این سیستم به جای لود کردن کل مدل، فقط نورونهای حیاتی و مهم رو برای هر تسک خاص شناسایی و لود میکنه.
💡 مزیت اصلی این روش:
بدون افت دقت، حافظه مصرفی و محاسبات به شدت کاهش پیدا میکنه که باعث میشه هوش مصنوعیهای پیشرفته در آینده روی گوشیهای معمولی هم خیلی روانتر اجرا بشن.
این پیشرفت میتونه دنیای اپلیکیشنهای هوش مصنوعیِ آفلاین رو حسابی متحول کنه! 📱⚡️
سازی
منبع: arXiv AI
