🚀 جهش بزرگ در سرعت آموزش هوش مصنوعی با DualKV!

⚠️ هشدار به محققان: چرا دقت مدل‌های شناسایی پهپاد گاهی «واقعی» نیست؟

محققان در مقاله‌ای جدید، تکنیک نوآورانه‌ای به نام «DualKV» را معرفی کرده‌اند که به طور چشمگیری سرعت آموزش مدل‌های زبانی (RL Training) را افزایش می‌دهد. ⚡️

ماجرا از این قرار است که در فرآیندهای یادگیری تقویتی (RL)، مدل‌ها مجبورند پرامپت‌های مشترک را برای هزاران پاسخ مختلف تکرار کنند که باعث هدررفت حافظه و قدرت پردازشی می‌شود. DualKV با بهینه‌سازی هسته‌های CUDA و بازطراحی خط لوله داده‌ها، این تکرارهای بیهوده را حذف می‌کند.

نتایج فوق‌العاده است: در مدل‌های Qwen3 با این روش، سرعت آپدیت سیاست (Policy Update) تا ۲ برابر افزایش یافته و امکان استفاده از دسته‌های داده (Micro-batches) بزرگ‌تر فراهم شده است. این یک خبر عالی برای توسعه‌دهندگانی است که با مدل‌های دارای پنجره متنی (Context Window) طولانی کار می‌کنند! 🧠💡

منبع: arXiv Machine Learning