امروزه هوش مصنوعی دیگر فقط یک ابزار نیست؛ بلکه در بسیاری از پروژهها به عنوان همکار در کنار انسان فعالیت میکند. اما چطور میتوان کیفیت این تعامل را اندازهگیری کرد؟ 🤔
محققان به تازگی چارچوب «HAS-Framework» و بنچمارک «HAS-Bench» را معرفی کردهاند که به طور اختصاصی روی ارزیابی سیستمهای «انسان-عامل» (Human-Agent Systems) تمرکز دارد. این سیستم به جای نگاه ساده به خروجی نهایی، فرآیند همکاری، نحوه دریافت بازخورد، حفظ امنیت و حتی میزان инициаتیو عملِ مدل را در شرایط مختلف بررسی میکند.
این نوآوری به ما کمک میکند بفهمیم هوش مصنوعی در چه زمانی و با چه سطحی از دخالتِ انسان، بهترین عملکرد را در حل مسائل پیچیده از خود نشان میدهد. 💡
منبع: arXiv AI
