🔍 ابزار جدید برای ارزیابی «هوش مصنوعی کدنویس»: معرفی Agent Retrieval Bench

🧠 چرا هوش مصنوعی گاهی «خیالات» می‌بیند؟

آیا هوش مصنوعی واقعاً می‌داند کدام فایل در یک پروژه نرم‌افزاری عظیم، کلید حل مشکل است؟ محققان به‌تازگی بنچمارک جدیدی به نام «Agent Retrieval Bench» را معرفی کرده‌اند که عملکرد مدل‌های کدنویس را در مرحله حساسِ «بازیابی اطلاعات» (Context Retrieval) به چالش می‌کشد.

این بنچمارک با استفاده از سناریوهای واقعی توسعه نرم‌افزار، بررسی می‌کند که آیا هوش مصنوعی می‌تواند به درستی فایل‌های مورد نیاز برای اصلاح کد، افزودن کامنت یا ردیابی باگ‌ها را پیدا کند یا خیر. نتایج اولیه نشان می‌دهد که هنوز هیچ مدل واحدی در تمام بخش‌ها برتر نیست و انتخاب ابزار مناسب برای یادگیریِ کدهای پروژه، تفاوت بزرگی در خروجی نهایی ایجاد می‌کند.

این پژوهش گام مهمی برای بهبود قابلیت اطمینان برنامه‌نویسان هوشمند (Coding Agents) است.

منبع: arXiv AI