تا به حال فکر کردهاید که مدلهای زبانی (LLM) چطور تصمیم میگیرند چه چیزی را در حافظه خود نگه دارند و چه چیزی را دور بریزند؟ روشهای فعلی معمولاً یا بر اساس قوانین سفتوسخت هستند یا پاداشهای کلی دریافت میکنند که دقت کافی ندارند.
محققان به تازگی چارچوب جدیدی به نام «AttriMem» ارائه کردهاند که با استفاده از یادگیری تقویتی (RL)، به ایجنتها یاد میدهد دقیقاً کدام بخش از اطلاعات در مسیر رسیدن به پاسخ نهایی حیاتی است. این یعنی ایجنتها در دیالوگهای طولانی بسیار هوشمندتر عمل کرده و نتایج دقیقتری ارائه میدهند. 🔥
این پیشرفت نه تنها باعث پایداری بیشتر در آموزش مدلها میشود، بلکه گامی بزرگ برای رسیدن به سیستمهای خودمختار با حافظه بلندمدت و قابل اعتماد است.
منبع: arXiv AI
