آیا تا به حال به محدودیتهای سختافزاری در آموزش مدلهای بزرگ فکر کردهاید؟ محققان در یک پیشرفت جدید، فریمورک Full-Stack FP4 را معرفی کردهاند که اجازه میدهد فرآیند آموزش (Pretraining) مدلهای زبانی با دقت ۴-بیت و با ثباتی بیسابقه انجام شود!
این روش با حل مشکلات عددی در لایههای خطی، بهینهسازها (مثل AdamW) و مکانیسم توجه (Attention)، عملاً اجازه میدهد مدلها بدون افت دقت چشمگیر، بسیار بهینهتر از قبل آموزش ببینند. با این تکنیک، هزینههای محاسباتی برای آموزش مدلهای غولآسا به شدت کاهش مییابد که خبر فوقالعادهای برای توسعهدهندگان است. 🔥
سازی
منبع: arXiv AI
