محققان در پژوهشی جدید، متوجه شدند که روشهای فعلی برای تعیین موقعیت کلمات (RoPE) در مدلهای ترنسفورمر به اندازه کافی بهینه نیستند. در روشهای مرسوم، تمامِ «سرهای توجه» (Attention Heads) به یک شکل پردازش میشوند، اما این مطالعه نشان میدهد که هر بخشِ مدل نیاز به تنظیمات فرکانسی و مقیاسبندی خاص خود دارد.
با معرفی AdaRoPE، حالا هر «هد» به صورت هوشمند و یادگیرنده عمل میکند که نتیجه آن بهبود عملکرد مدل در متنهای بسیار طولانی (Long-context) و حفظ کیفیت در متنهای کوتاه است. یک گام دیگر برای هوشمندتر شدن LLMها! 🧠✨
منبع: arXiv NLP
