محققان در مقالهای جدید راهکار جالبی برای کاهش هزینههای پردازشی مدلهای زبانی بزرگ معرفی کردهاند. این متد با نام «Prompt Compression via Activation Aggregation» به جای پردازش تمام توکنهای ورودی، اطلاعات کلیدی پرامپت را در یک «بردار فعالسازی» (Activation Vector) خلاصه میکند.
✅ چرا این خبر مهم است؟
این روش اجازه میدهد بدون نیاز به پردازش مجدد کل پرامپت، پاسخها با سرعت بیشتر و دقت بسیار بالا (با افت عملکرد کمتر از ۲ درصد) تولید شوند. این یعنی صرفهجویی چشمگیر در محاسبات و بهینهسازی منابع برای مدلهای هوش مصنوعی!
دنیای هوش مصنوعی روزبهروز در حال بهینهتر شدن است و این دستاورد میتواند راه را برای اجرای مدلهای قدرتمند روی سختافزارهای ضعیفتر هموارتر کند. 🧠⚡️
منبع: arXiv Machine Learning
