محققان در مقالهای جدید، چالش بزرگی را در ارزیابی «حافظه طولانیمدت» در مدلهای زبانی بزرگ (LLM) مطرح کردهاند. آنها معتقدند معیارهای فعلی نمیتوانند بهخوبی نشاندهنده توانایی مدل در بازیابی اطلاعات دقیق از متون علمی باشند.
نکات کلیدی این پژوهش:
🔹 معرفی دو بنچمارک جدید به نامهای PAIM و PTr برای ارزیابی دقیقتر در متون علمی.
🔹 اثبات اینکه برتری برخی مدلها در لیدربوردها تنها به دلیل استفاده از «بودجه بازیابی» (Context Budget) بسیار بالا است و نه هوشمندی مدل!
🔹 تاکید بر اینکه ترکیب روشهای بازیابی Sparse و Dense (هیبرید)، کلید اصلی رسیدن به دقت بالاتر است.
این مقاله زنگ خطری برای توسعهدهندگان است که هنگام ارزیابی مدلهای ایجنتیک، فریب امتیازهای خام را نخورند و به جزئیات پروتکلهای ارزیابی توجه بیشتری کنند.
منبع: arXiv AI
