دانشمندان در تحقیق جدیدی به سراغ پدیده عجیب «Grokking» رفتهاند؛ وضعیتی که در آن مدلهای هوش مصنوعی ابتدا دادهها را حفظ میکنند و پس از مدتی ناگهان به «تعمیمدهی» (Generalization) میرسند.
این مقاله با استفاده از مدلهای ریاضی دقیق و توابع هولومورفیک، نشان میدهد که چرا برخی مدلها در یادگیری عملیات ریاضی شکست میخورند و برخی دیگر موفق میشوند. این یافتهها ثابت میکند که ساختار هندسی و جبری شبکه، نقش تعیینکنندهای در توانایی یادگیری و تعمیم مدلها دارد و دیگر نیازی به حدس و گمان در مورد علت این اتفاق نیست. این گام بزرگی برای درک بهتر نحوه یادگیری مدلهای بزرگ زبانی و هوش مصنوعی مدرن است.
منبع: arXiv Machine Learning
