اگر با مدلهای استدلالگر پیشرفته مثل DeepSeek-R1 کار کرده باشید، حتماً میدانید که پردازش متنهای خیلی طولانی چقدر سنگین و هزینهبر است. مشکل اصلی، پیچیدگی محاسباتی «Self-Attention» است که با افزایش طول متن، به صورت نمایی بالا میرود.
حالا محققان ماژول جدیدی به نام LISA (Linear-Indexed Sparse Attention) معرفی کردهاند که بدون نیاز به آموزش مجدد مدل، مثل یک قطعه «Plug-and-Play» به مدلهای فعلی اضافه میشود.
این روش با ترکیب دو قابلیت «Attention خطی» برای حافظه بلندمدت و «Indexing» برای تمرکز روی توکنهای کلیدی، پیچیدگی محاسباتی را بهشدت کاهش میدهد. نتیجه؟ استدلالهای طولانیتر با هزینه محاسباتی بسیار کمتر! 🧠✨
منبع: arXiv AI
