محققان در پژوهشی جدید، بنچمارک جذابی به نام «ProEvent» را معرفی کردهاند که توانایی مدلهای هوش مصنوعی در پیشبینی و مدیریت برنامههای کاربران را به چالش میکشد.
مشکل اینجاست که دستیارهای هوشمند فعلی در تشخیص رویدادهای ضمنی (مثل کنسل کردن یک قرار یا تغییر برنامه) ضعفهای جدی دارند و طبق این تحقیق، حتی مدلهای بسیار پیشرفته مثل GPT-5.1 هم در اکثر مواقع در این زمینه دچار خطا میشوند. این بنچمارک به توسعهدهندگان کمک میکند تا ایجنتهای هوشمند را برای زندگی واقعی و درک بهتر مکالمات روزمره آمادهتر کنند. به نظر شما هوش مصنوعی تا چه حد در مدیریت برنامههای شخصی به ما اعتماد دارد؟
های_زبانی
منبع: arXiv AI
