آیا هوش مصنوعی واقعاً میداند کدام فایل در یک پروژه نرمافزاری عظیم، کلید حل مشکل است؟ محققان بهتازگی بنچمارک جدیدی به نام «Agent Retrieval Bench» را معرفی کردهاند که عملکرد مدلهای کدنویس را در مرحله حساسِ «بازیابی اطلاعات» (Context Retrieval) به چالش میکشد.
این بنچمارک با استفاده از سناریوهای واقعی توسعه نرمافزار، بررسی میکند که آیا هوش مصنوعی میتواند به درستی فایلهای مورد نیاز برای اصلاح کد، افزودن کامنت یا ردیابی باگها را پیدا کند یا خیر. نتایج اولیه نشان میدهد که هنوز هیچ مدل واحدی در تمام بخشها برتر نیست و انتخاب ابزار مناسب برای یادگیریِ کدهای پروژه، تفاوت بزرگی در خروجی نهایی ایجاد میکند.
این پژوهش گام مهمی برای بهبود قابلیت اطمینان برنامهنویسان هوشمند (Coding Agents) است.
منبع: arXiv AI



