محققان در مقالهای جدید به تحلیل عمیق ریاضی «RoPE» پرداختهاند؛ تکنیکی که امروزه به عنوان استانداردی در معماری مدلهای زبانی بزرگ (مثل Llama) برای درک موقعیت توکنها استفاده میشود.
در این پژوهش، محققان با بررسی دینامیکِ پیوسته و اثرات چرخش در فضای کوئری و کلید، به درک دقیقتری از رفتار این لایهها در تعادلِ مدل دست یافتهاند. این مطالعه به ویژه برای متخصصان حوزه معماری مدلهای زبانی (LLMs) که به دنبال بهینهسازی دقیقترِ سازوکار توجه (Attention) هستند، بسیار حائز اهمیت است.
منبع: arXiv Machine Learning
