محققان در یک پژوهش جدید، روشی نوآورانه برای ارزیابی «حافظه» در عاملهای هوش مصنوعی (AI Agents) ابداع کردهاند. برخلاف بنچمارکهای قدیمی که معمولاً با مشکلات خطای داده و تاریخچه تعاملات کوتاه مواجه بودند، این متد جدید با استفاده از «سناریوهای زندگی» مصنوعی، دقت حافظه مدلها را در بازههای زمانی طولانی بررسی میکند.
نتایج این تحقیق نشان میدهد که معماریهای مختلف حافظه، در بازههای زمانی کوتاه و بلند، رفتارهای متفاوتی دارند؛ به طوری که برخی مدلها که در کوتاهمدت عملکرد عالی دارند، با افزایش زمان دچار افت شدید بازیابی اطلاعات میشوند. این یافتهها مسیر را برای توسعه مدلهای حافظهمحورِ پایدارتر در آینده هموار میکند. 🚀
منبع: arXiv NLP
