🧠 بهینه‌سازی دقیق‌تر ترنسفورمرها با روش جدید SBO-AdamW

🧠 چرا هوش مصنوعی گاهی «خیالات» می‌بیند؟

آیا می‌دانستید در فرآیند آموزش مدل‌های هوش مصنوعی، بخشی از تغییرات وزن‌ها در واقع تکراری هستند؟ محققان در مقاله‌ای جدید کشف کرده‌اند که به دلیل رفتار لایه‌های آفین، تغییرات وزن و بایاس (Bias) همپوشانی دارند.

آن‌ها با معرفی «SBO-AdamW» (بهینه‌ساز متعامدِ شکل و مرز)، توانسته‌اند این تداخل را رفع کنند. نتیجه این کار افزایش چشمگیر دقت مدل‌های ترنسفورمر بوده است؛ مثلاً دقت یک مدل نمونه از ۸۱.۶٪ به بیش از ۸۵٪ ارتقا یافته است! این یعنی راهی هوشمندانه‌تر برای آموزش مدل‌ها بدون نیاز به منابع پردازشی اضافه. 🚀

منبع: arXiv Machine Learning