مدلهای زبانی (LLM) برای به خاطر سپردن اطلاعات در درازمدت با چالش «افت کیفیت حافظه» روبرو هستند. محققان با معرفی فریمورک جدید «MemDefrag» این مشکل را حل کردهاند.
MemDefrag چطور کار میکند؟
این مدل با شناسایی سیگنالهای لایههای میانی در ترنسفورمرها، میتواند حافظه مدل را مدیریت کند (مرتبسازی و فیلتر کردن اطلاعات) و در صورت پر شدن حافظه، دادههای کماهمیت را فراموش کند.
نتایج آزمایشها نشان میدهد که با این تکنیک، قدرت بازیابی اطلاعات تا حدود ۴۳ درصد بهبود مییابد؛ آن هم بدون نیاز به آموزش مجدد مدل! یک گام بزرگ برای هوشمندتر شدن دستیارهای دیجیتال ما.
منبع: arXiv NLP
