💡 راز عملکرد RoPE در مدل‌های زبانی کشف شد!

⚠️ هشدار به محققان: چرا دقت مدل‌های شناسایی پهپاد گاهی «واقعی» نیست؟

محققان در یک پژوهش تازه، معمای جالبی را حل کرده‌اند: چرا مدل‌های هوش مصنوعی (Transformers) در استفاده از فرکانس‌های موقعیتی (RoPE) به این شکل عمل می‌کنند؟

این مقاله نشان می‌دهد که انتخاب فرکانس‌ها در RoPE کاملاً با ساختار داده‌های آموزشی مرتبط است. در واقع، مدل‌ها فرکانس‌ها را طوری تنظیم می‌کنند که با فواصل نسبی در داده‌های متنی هماهنگ باشند. این کشف کلیدی، درک ما را از چگونگی تعمیم‌دهی مدل‌ها به متون طولانی‌تر (Long-context) بسیار شفاف‌تر می‌کند و نشان می‌دهد چرا درک «مقیاس» در متن‌های طولانی تا این حد برای هوش مصنوعی حیاتی است.

یک گام دیگر به سمت ساخت مدل‌های زبانی هوشمندتر و دقیق‌تر! 🤖🚀

منبع: arXiv Machine Learning