🔍 رمزگشایی از دینامیکِ Rotary Position Embeddings (RoPE)

🧠 چرا هوش مصنوعی گاهی «خیالات» می‌بیند؟

محققان در مقاله‌ای جدید به تحلیل عمیق ریاضی «RoPE» پرداخته‌اند؛ تکنیکی که امروزه به عنوان استانداردی در معماری مدل‌های زبانی بزرگ (مثل Llama) برای درک موقعیت توکن‌ها استفاده می‌شود.

در این پژوهش، محققان با بررسی دینامیکِ پیوسته و اثرات چرخش در فضای کوئری و کلید، به درک دقیق‌تری از رفتار این لایه‌ها در تعادلِ مدل دست یافته‌اند. این مطالعه به ویژه برای متخصصان حوزه معماری مدل‌های زبانی (LLMs) که به دنبال بهینه‌سازی دقیق‌ترِ سازوکار توجه (Attention) هستند، بسیار حائز اهمیت است.

منبع: arXiv Machine Learning