آیا مدلهای زبانی واقعاً میتوانند صفر تا صد یک نرمافزار را بسازند؟ تا امروز، بیشتر بنچمارکها برای سنجش این توانایی، هوش مصنوعی را محدود به پر کردنِ کدهای از پیش آماده میکردند که چندان واقعگرایانه نبود.
اما حالا با معرفی CLI-Tool-Bench، محققان یک چالش جدید طراحی کردهاند! این بنچمارک، ایجنتهای هوش مصنوعی را در یک محیط خالی قرار میدهد و از آنها میخواهد بدون هیچ راهنماییِ ساختاری، ابزارهای خط فرمان (CLI) را از صفر خلق کنند.
این یعنی سنجشِ واقعیِ تواناییِ «برنامهنویسیِ مستقل» و حل مسائلِ دنیای واقعی. حالا باید دید کدام مدل هوش مصنوعی میتواند در تستهای جعبهسیاه ما سربلند بیرون بیاید! 💪💻
منبع: arXiv AI
