آیا هوش مصنوعی واقعاً میتواند کارهای روزمره ما در وب مثل خرید آنلاین، رزرو نوبت یا ارسال فرمهای شغلی را به تنهایی انجام دهد؟
محققان بنچمارک جدیدی به نام «ClawBench» را طراحی کردهاند که شامل ۱۵۳ تسک کاربردی در ۱۴۴ سایت مختلف است. نکته مهم اینجاست که برخلاف تستهای آزمایشگاهی، ClawBench روی وبسایتهای واقعی اجرا میشود و چالشهای پیچیده دنیای واقعی را به چالش میکشد.
نتایج اولیه نشان میدهد حتی مدلهای قدرتمندی مثل Claude Sonnet 4.6 هم فقط از پسِ حدود ۳۳٪ کارها برمیآیند که نشان میدهد راه زیادی تا هوش مصنوعی کاملاً مستقل باقی مانده است. 🏗️✨
منبع: arXiv AI
