یکی از بزرگترین چالشهای مدلهای زبانی بزرگ، محدودیت در پردازش متنهای بسیار طولانی و مصرف بالای حافظه GPU است. حالا محققان معماری جدیدی به نام «RIS» (Reduced Interaction Sampling) معرفی کردهاند که بدون نیاز به تغییر وزنهای مدل، پیچیدگی محاسباتی توجه (Attention) را از حالت مربعی به O(N log N) کاهش میدهد!
🔹 چرا این خبر مهم است؟
این روش به مدلها اجازه میدهد با استفاده از منابع سختافزاری معمولی، متون بسیار طولانی را (حتی فراتر از ۶۵ هزار توکن) با دقت بالا پردازش کنند. نتایج نشان میدهد که این روش نه تنها حافظه را مدیریت میکند، بلکه با کاهش نویز، عملکرد مدل را در بازیابی اطلاعات بهبود میبخشد.
با این تکنیک، میتوانیم منتظر مدلهای هوشمندتری باشیم که بدون نیاز به ابرکامپیوترهای گرانقیمت، کتابخانهها و مستندات حجیم را برایمان تحلیل کنند.
منبع: arXiv Machine Learning
