در حالی که همه به دنبال پیچیدهتر کردن مدلهای هوش مصنوعی هستند، یک مقاله جدید علمی نشان داده که نباید «مدلهای درجه دوم» (Quadratic Models) را دستکم گرفت! 📉
محققان در این پژوهش جدید متوجه شدند که حتی در مدلهای زبانی بزرگ (LLM) با ۱۵۰ میلیون پارامتر، مدلهای ساده ریاضی میتوانند به طرز شگفتانگیزی رفتار مدل در طول آموزش را پیشبینی کنند. این یافته به ما کمک میکند تا بفهمیم مدلها در لایههای عمیق چطور یاد میگیرند و پایداری آنها در حین آموزش چگونه تضمین میشود. 🧠✨
این یعنی درکِ دقیقترِ آنچه درون «جعبه سیاه» هوش مصنوعی میگذرد، شاید به آن سختیهایی که فکر میکردیم نباشد!
منبع: arXiv AI
