آیا میدانستید در فرآیند آموزش مدلهای هوش مصنوعی، بخشی از تغییرات وزنها در واقع تکراری هستند؟ محققان در مقالهای جدید کشف کردهاند که به دلیل رفتار لایههای آفین، تغییرات وزن و بایاس (Bias) همپوشانی دارند.
آنها با معرفی «SBO-AdamW» (بهینهساز متعامدِ شکل و مرز)، توانستهاند این تداخل را رفع کنند. نتیجه این کار افزایش چشمگیر دقت مدلهای ترنسفورمر بوده است؛ مثلاً دقت یک مدل نمونه از ۸۱.۶٪ به بیش از ۸۵٪ ارتقا یافته است! این یعنی راهی هوشمندانهتر برای آموزش مدلها بدون نیاز به منابع پردازشی اضافه. 🚀
منبع: arXiv Machine Learning
