یکی از نقاط ضعف مدلهای زبانی بزرگ (LLM)، ضعف در مدیریت حافظه بلندمدت و استدلالهای زمانی است. حالا محققان بنچمارک جدیدی به نام «RUMBA» را معرفی کردهاند که به طور اختصاصی برای ارزیابی حافظه گفتوگویی طراحی شده است.
این بنچمارک با تمرکز بر زبان روسی (و زیرمجموعهای از انگلیسی)، برخلاف ابزارهای قبلی که فقط به بازیابی اطلاعات اکتفا میکردند، توانایی مدل در استدلالهای زمانی و ترکیب اطلاعات در طول جلسات مختلف گفتگو را به چالش میکشد. این ابزار جدید میتواند به دانشمندان کمک کند تا بفهمند مدلهای هوش مصنوعی دقیقاً کجا در یادآوری خاطرات و تعاملات گذشته دچار خطا میشوند.
منبع: arXiv AI
