🔍 چالش جدید در آموزش مدل‌های بزرگ: زیرفضاهای غیرقابل ردیابی!

⚠️ هشدار به محققان: چرا دقت مدل‌های شناسایی پهپاد گاهی «واقعی» نیست؟

محققان در مقاله جدیدی به بررسی عمیق تکنیک‌های بهینه‌سازی حافظه‌محور (مانند GaLore) پرداختند. این تکنیک‌ها بر پایه این فرض بنا شده‌اند که زیرفضاهای «رتبه-r» در آموزش مدل‌ها، اشیایی با تغییرات آهسته هستند که می‌توان آن‌ها را ردیابی کرد.

اما نتایج این پژوهش نشان می‌دهد که این زیرفضاها تا حد زیادی تحت تأثیر «نویز تخمین‌گر» هستند و برخلاف تصور، به راحتی قابل ردیابی نیستند. در این مقاله پیشنهاد شده است که به‌جای روش‌های فعلی، از استراتژی‌های جدیدی برای مدیریت «وضعیت بهینه‌ساز» استفاده شود تا کارایی مدل‌ها در مقیاس‌های بزرگ حفظ شود.

این تحقیق گامی مهم برای درک بهتر رفتارهای داخلی LLMها و بهبود روش‌های آموزشی فوق‌سریع است که برای توسعه‌دهندگان و محققان این حوزه بسیار حائز اهمیت است. 📊

‌سازی

منبع: arXiv Machine Learning