🚀 کاهش مصرف حافظه LLMها بدون افت کیفیت: معرفی تکنیک DGAP

⚠️ هشدار به محققان: چرا دقت مدل‌های شناسایی پهپاد گاهی «واقعی» نیست؟

مدل‌های زبانی بزرگ (مثل Llama-3.1) برای پردازش متن‌های طولانی به حافظه بسیار زیادی نیاز دارند (KV Cache). استفاده از کوانتیزاسیون کم‌بیت، این مصرف را کم می‌کند اما دقت مدل را به شدت پایین می‌آورد.

محققان در پژوهش جدید خود، روشی به نام DGAP ارائه داده‌اند که با شناسایی و اصلاح توزیع لاگیت‌ها (Logits) در لحظه، اجازه می‌دهد مدل‌ها با کمترین میزان حافظه، همان دقت اصلی خود را حفظ کنند. این یعنی اجرای مدل‌های بزرگ روی سخت‌افزارهای ضعیف‌تر، بدون قربانی کردن کیفیت خروجی!

💡 این پیشرفت گام بزرگی برای اجرای محلی (Local) هوش مصنوعی روی سیستم‌های شخصی است.

‌سازی

منبع: arXiv AI