محققان در مقالهای جدید به بررسی یکی از مشکلات اساسی مدلهای ترنسفورمر یعنی «ناپایداری عددی» (Numerical Fragility) پرداختهاند. وقتی مدلها را با دقت پایین (Low-precision) اجرا میکنیم، خطاهای پیشبینی افزایش مییابد.
در این پژوهش، متدی با نام BGSS معرفی شده که با شناسایی و کنترل هوشمندِ خطاهای لایهبندی در حین پردازش، دقت مدلهایی مثل GPT-2 را بهطور چشمگیری بهبود میبخشد. این دستاورد میتواند به اجرای بهینهتر و پایدارتر مدلهای بزرگ زبانی در سختافزارهای محدود کمک کند. 🚀🧠
منبع: arXiv Machine Learning
