آیا تا به حال به این فکر کردهاید که چرا برخی مدلهای هوش مصنوعی پس از مدتها آموزش، ناگهان «هوشمندتر» میشوند؟ پدیدهای که به آن Grokking میگویند.
محققان در یک پژوهش جدید با بررسی یک مدل کوچک ۱۲ هزار پارامتری (Glimmer-1-Base)، به نتایج جالبی رسیدهاند:
✅ یافتههای کلیدی:
• پدیده Grokking برخلاف تصور، یک فرآیند شکننده و کاملاً وابسته به شرایط است.
• این رفتار بیشتر از ساختار مسئله، به میزان «پوشش دادههای آموزشی» بستگی دارد.
• نتایج نشان میدهد که کوچکترین تغییرات در محیط سختافزاری (مثلاً تغییر تعداد هستههای پردازشی CPU) میتواند خروجی مدل را تغییر دهد!
این مطالعه نشان میدهد که برای درک بهتر رفتارهای هوش مصنوعی، باید به جای تمرکز صرف بر مدلهای غولآسا، نیمنگاهی هم به مدلهای کوچک و شفاف داشته باشیم. 🧠
منبع: arXiv AI
