محققان تکنیک جدیدی به نام «RoVE» (Rotary Value Embeddings) را معرفی کردند که یک نقص کلیدی در مدلهای زبانی را هدف قرار داده است.
در مدلهای فعلی، «مقدار» (Value) توکنها نسبت به جایگاهشان در متن بیتفاوت است. اما RoVE با چرخاندن همزمان کلیدها و مقادیر، این نقص را برطرف کرده و باعث میشود مدلها در درک زمینههای طولانی (Long-context) و یادگیری درونمتنی (In-context Learning) بسیار دقیقتر عمل کنند.
این روشِ هوشمندانه نهتنها پرفورمنس مدلهای GPT-2 را در آزمایشها بهبود بخشیده، بلکه راه را برای ساخت مدلهایی با درکِ عمیقتر از متنهای طولانی هموارتر کرده است. دنیای معماریهای Transformer هر روز جذابتر میشود! 🧠✨
منبع: arXiv AI
