تا به حال فکر کردهاید که چرا مدلهای زبانی بزرگ (LLM) با افزایش مقیاس، دقیقتر میشوند؟ محققان بالاخره موفق شدند اولین نظریه علمی برای پیشبینی دقیق «قوانین مقیاسپذیری عصبی» را کشف کنند! 💡
این تحقیق جدید نشان میدهد که تنها با تحلیل دو ویژگی آماری زبان، یعنی «میزان همبستگی بین کلمات» و «آنتروپی شرطی»، میتوان پیشبینی کرد که یک مدل چقدر با دادههای بیشتر هوشمندتر میشود. این دستاورد بزرگ، دیگر نیازی به حدس و گمانهای تجربی ندارد و به ما کمک میکند مدلهای بهینهتری را از صفر آموزش دهیم. عملکرد فوقالعاده این نظریه روی مدلهایی مثل GPT-2 و LLaMA ثابت شده است. 🚀
منبع: arXiv AI
