🧠 رمزگشایی از پدیده «Grokking» در شبکه‌های عصبی

⚠️ هشدار به محققان: چرا دقت مدل‌های شناسایی پهپاد گاهی «واقعی» نیست؟

آیا تا به حال برایتان سوال شده که چرا برخی مدل‌های هوش مصنوعی بعد از مدت طولانی آموزش، ناگهان در یادگیری تعمیم می‌یابند؟ به این پدیده جذاب در دنیای یادگیری ماشین، «Grokking» می‌گویند.

در مطالعه جدیدی که به تازگی منتشر شده، محققان با استفاده از هندسه تصادفی توانستند مکانیسم پشت پرده این انتقال ناگهانی را توضیح دهند. طبق این مدل جدید، فضای پارامترهای مدل مانند یک «پوست و هسته» عمل می‌کند که مدل پس از طی کردن مراحل یادگیری اولیه (حفظ کردن)، بالاخره به «هسته اصلی» یا همان قدرت تعمیم‌دهی می‌رسد.

این تحقیق می‌تواند در آینده به ما کمک کند تا مدل‌های هوشمندتر و بهینه‌تری بسازیم که سریع‌تر و دقیق‌تر یاد می‌گیرند! 🚀

منبع: arXiv AI