🚀 هوش مصنوعی در قامتِ برنامه‌نویس؛ معرفی بنچمارک CLI-Tool-Bench

⚠️ هشدار به محققان: چرا دقت مدل‌های شناسایی پهپاد گاهی «واقعی» نیست؟

آیا مدل‌های زبانی واقعاً می‌توانند صفر تا صد یک نرم‌افزار را بسازند؟ تا امروز، بیشتر بنچمارک‌ها برای سنجش این توانایی، هوش مصنوعی را محدود به پر کردنِ کدهای از پیش آماده می‌کردند که چندان واقع‌گرایانه نبود.

اما حالا با معرفی CLI-Tool-Bench، محققان یک چالش جدید طراحی کرده‌اند! این بنچمارک، ایجنت‌های هوش مصنوعی را در یک محیط خالی قرار می‌دهد و از آن‌ها می‌خواهد بدون هیچ راهنماییِ ساختاری، ابزارهای خط فرمان (CLI) را از صفر خلق کنند.

این یعنی سنجشِ واقعیِ تواناییِ «برنامه‌نویسیِ مستقل» و حل مسائلِ دنیای واقعی. حالا باید دید کدام مدل هوش مصنوعی می‌تواند در تست‌های جعبه‌سیاه ما سربلند بیرون بیاید! 💪💻

منبع: arXiv AI