مدلهای زبانی بزرگ (مثل Llama-3.1) برای پردازش متنهای طولانی به حافظه بسیار زیادی نیاز دارند (KV Cache). استفاده از کوانتیزاسیون کمبیت، این مصرف را کم میکند اما دقت مدل را به شدت پایین میآورد.
محققان در پژوهش جدید خود، روشی به نام DGAP ارائه دادهاند که با شناسایی و اصلاح توزیع لاگیتها (Logits) در لحظه، اجازه میدهد مدلها با کمترین میزان حافظه، همان دقت اصلی خود را حفظ کنند. این یعنی اجرای مدلهای بزرگ روی سختافزارهای ضعیفتر، بدون قربانی کردن کیفیت خروجی!
💡 این پیشرفت گام بزرگی برای اجرای محلی (Local) هوش مصنوعی روی سیستمهای شخصی است.
سازی
منبع: arXiv AI
