حتماً تا به حال عبارت «Grokking» یا همان درک ناگهانی مدلهای هوش مصنوعی را شنیدهاید؛ وضعیتی که مدل ابتدا دادهها را حفظ میکند و ناگهان پس از مدتی طولانی، شروع به یادگیری و تعمیمدهی واقعی میکند.
در پژوهش علمی جدیدی که در arXiv منتشر شده، محققان بالاخره توانستند با یک مدل هندسه تصادفی، توضیح دهند که چرا این اتفاق میافتد. آنها نشان دادند که فضای راهحلهای مدل، ساختاری شبیه به «پوسته و هسته» دارد؛ جایی که مدل در ابتدا در یک لایه سطحی گیر میکند و پس از عبور از آن، به هسته مرکزی که همان درک واقعی و تعمیمدهی است، میرسد.
این مقاله نه تنها سازوکار یادگیری مدلهای بزرگ را شفافتر میکند، بلکه قوانین ریاضی جدیدی برای تنظیم نرخ یادگیری و بهینهسازی مدلها ارائه میدهد که برای توسعهدهندگان هوش مصنوعی بسیار کاربردی است. 🧠💡
منبع: arXiv AI
