🔍 چالش بزرگ در بهینه‌سازی مدل‌های زبانی: آیا زیرفضاهای آموزشی واقعاً قابل ردیابی هستند؟

⚠️ هشدار به محققان: چرا دقت مدل‌های شناسایی پهپاد گاهی «واقعی» نیست؟

بسیاری از بهینه‌سازهای حافظه‌محور مثل GaLore، با این فرض کار می‌کنند که می‌توان زیرفضاهای گرادیان را در حین آموزش مدل‌های بزرگ ردیابی کرد. اما پژوهش جدیدی که به‌تازگی در arXiv منتشر شده، نتایج عجیبی را نشان می‌دهد!

محققان متوجه شدند که آنچه ما به عنوان «زیرفضای پایدار» می‌شناسیم، در واقع ترکیبی از نویز است و بخش بسیار کوچکی از آن واقعاً قابل بازتولید است. این مقاله پیشنهاد می‌دهد که به‌جای تلاش برای ردیابی این زیرفضاها، باید روی استراتژی‌های هوشمندانه‌تری برای انتقال «لحظه دوم» (Second Moment) در الگوریتم‌هایی مثل Adam تمرکز کنیم تا کیفیت آموزش مدل‌ها در مقیاس‌های بزرگ حفظ شود.

این کشف می‌تواند نقشه راه جدیدی برای توسعه‌دهندگان مدل‌های زبانی و افزایش بهره‌وری در آموزش مدل‌های حجیم باشد. 🧠⚙️

‌سازی

منبع: arXiv Machine Learning