🔍 معمای «گراک کردن» (Grokking) در شبکه‌های عصبی حل شد!

⚠️ هشدار به محققان: چرا دقت مدل‌های شناسایی پهپاد گاهی «واقعی» نیست؟

دانشمندان در تحقیق جدیدی به سراغ پدیده عجیب «Grokking» رفته‌اند؛ وضعیتی که در آن مدل‌های هوش مصنوعی ابتدا داده‌ها را حفظ می‌کنند و پس از مدتی ناگهان به «تعمیم‌دهی» (Generalization) می‌رسند.

این مقاله با استفاده از مدل‌های ریاضی دقیق و توابع هولومورفیک، نشان می‌دهد که چرا برخی مدل‌ها در یادگیری عملیات ریاضی شکست می‌خورند و برخی دیگر موفق می‌شوند. این یافته‌ها ثابت می‌کند که ساختار هندسی و جبری شبکه، نقش تعیین‌کننده‌ای در توانایی یادگیری و تعمیم مدل‌ها دارد و دیگر نیازی به حدس و گمان در مورد علت این اتفاق نیست. این گام بزرگی برای درک بهتر نحوه یادگیری مدل‌های بزرگ زبانی و هوش مصنوعی مدرن است.

منبع: arXiv Machine Learning