محققان در یک پژوهش تازه، معمای جالبی را حل کردهاند: چرا مدلهای هوش مصنوعی (Transformers) در استفاده از فرکانسهای موقعیتی (RoPE) به این شکل عمل میکنند؟
این مقاله نشان میدهد که انتخاب فرکانسها در RoPE کاملاً با ساختار دادههای آموزشی مرتبط است. در واقع، مدلها فرکانسها را طوری تنظیم میکنند که با فواصل نسبی در دادههای متنی هماهنگ باشند. این کشف کلیدی، درک ما را از چگونگی تعمیمدهی مدلها به متون طولانیتر (Long-context) بسیار شفافتر میکند و نشان میدهد چرا درک «مقیاس» در متنهای طولانی تا این حد برای هوش مصنوعی حیاتی است.
یک گام دیگر به سمت ساخت مدلهای زبانی هوشمندتر و دقیقتر! 🤖🚀
منبع: arXiv Machine Learning
