🚀 WeaveBench: سنجشی جدید برای هوش مصنوعی‌های همه‌کاره!

⚠️ هشدار به محققان: چرا دقت مدل‌های شناسایی پهپاد گاهی «واقعی» نیست؟

تا امروز مدل‌های هوش مصنوعی معمولاً در محیط‌های ایزوله تست می‌شدند، اما محققان با معرفی WeaveBench گام بزرگی برای ارزیابی «عامل‌های هوشمند» (Agents) برداشته‌اند.

این بنچمارک جدید، قدرت مدل‌ها را در محیط‌های واقعی و پیچیده به چالش می‌کشد؛ جایی که هوش مصنوعی باید همزمان با رابط کاربری گرافیکی (GUI)، خط فرمان (CLI) و کدنویسی در یک محیط اوبونتو تعامل داشته باشد. نتایج اولیه نشان می‌دهد که حتی قدرتمندترین مدل‌ها هم در این دنیای واقعی عملکرد چندان درخشانی ندارند و تنها ۴۱.۲٪ موفقیت کسب کرده‌اند!

این یعنی راه زیادی تا ساخت دستیارهای هوشمندِ کاملاً مستقل که بتوانند کارهای پیچیده روزمره ما را در کامپیوتر انجام دهند، باقی مانده است. 🤖💻

منبع: arXiv AI