محققان در یک پژوهش تئوری و تجربی جدید، به درک عمیقتری از پدیده «Grokking» دست پیدا کردند. این پدیده که در آن مدلهای هوش مصنوعی مدتها پس از مرحله «بیشبرازش» (Overfitting) به ناگهان شروع به یادگیری و تعمیم دقیق میکنند، همیشه برای متخصصان سوالبرانگیز بود.
نتایج این تحقیق نشان میدهد که Grokking یک شکست در یادگیری عمیق نیست، بلکه نتیجه شرایط خاص آموزشی است. این کشف کمک میکند بدون تغییر در ساختار مدل، و تنها با تنظیم دقیق پارامترهای آموزشی، کنترل بهتری روی نحوه یادگیری مدلها داشته باشیم. 🧠💡
منبع: arXiv Machine Learning
