محققان در مقالهای جدید به نقص بزرگی در ارزیابی ایجنتهای هوش مصنوعی (Personal AI Agents) اشاره کردهاند. برخلاف مدلهای ثابت، ایجنتهای شخصی به مرور زمان با حافظه، مهارتها و تنظیمات خاص هر کاربر تکامل پیدا میکنند.
نکته کلیدی اینجاست: بنچمارکهای فعلی نمیتوانند تغییرات در حافظه و رفتار ایجنت را در طول زمان (Temporal Interventions) بهدرستی بسنجند. این پژوهش پیشنهاد میدهد که برای ارزیابی دقیقتر، باید سناریوهای زمانی تعریف کنیم که در آن ایجنت با وجود تغییر در حالتهای کاربری، رفتارهای پایدار و منطقی از خود نشان دهد.
این یعنی در آینده، استانداردهای جدیدی برای سنجش «هوشمندی» و «قابلیت اطمینان» ایجنتهای شخصی خواهیم داشت که بسیار نزدیکتر به تجربه واقعی ما از هوش مصنوعی است. ✅
منبع: arXiv Machine Learning
