تا امروز مدلهای هوش مصنوعی معمولاً در محیطهای ایزوله تست میشدند، اما محققان با معرفی WeaveBench گام بزرگی برای ارزیابی «عاملهای هوشمند» (Agents) برداشتهاند.
این بنچمارک جدید، قدرت مدلها را در محیطهای واقعی و پیچیده به چالش میکشد؛ جایی که هوش مصنوعی باید همزمان با رابط کاربری گرافیکی (GUI)، خط فرمان (CLI) و کدنویسی در یک محیط اوبونتو تعامل داشته باشد. نتایج اولیه نشان میدهد که حتی قدرتمندترین مدلها هم در این دنیای واقعی عملکرد چندان درخشانی ندارند و تنها ۴۱.۲٪ موفقیت کسب کردهاند!
این یعنی راه زیادی تا ساخت دستیارهای هوشمندِ کاملاً مستقل که بتوانند کارهای پیچیده روزمره ما را در کامپیوتر انجام دهند، باقی مانده است. 🤖💻
منبع: arXiv AI
