🚀 چالش جدید برای حافظه مدل‌های زبانی: معرفی RUMBA!

🧠 چرا هوش مصنوعی گاهی «خیالات» می‌بیند؟

یکی از نقاط ضعف مدل‌های زبانی بزرگ (LLM)، ضعف در مدیریت حافظه بلندمدت و استدلال‌های زمانی است. حالا محققان بنچمارک جدیدی به نام «RUMBA» را معرفی کرده‌اند که به طور اختصاصی برای ارزیابی حافظه گفت‌وگویی طراحی شده است.

این بنچمارک با تمرکز بر زبان روسی (و زیرمجموعه‌ای از انگلیسی)، برخلاف ابزارهای قبلی که فقط به بازیابی اطلاعات اکتفا می‌کردند، توانایی مدل در استدلال‌های زمانی و ترکیب اطلاعات در طول جلسات مختلف گفتگو را به چالش می‌کشد. این ابزار جدید می‌تواند به دانشمندان کمک کند تا بفهمند مدل‌های هوش مصنوعی دقیقاً کجا در یادآوری خاطرات و تعاملات گذشته دچار خطا می‌شوند.

منبع: arXiv AI