آیا هوش مصنوعی که خودش ابزار برنامهنویسی میسازد، واقعاً قابل اعتماد است؟ محققان در پژوهش جدید خود به یک مشکل اساسی به نام «شکاف تأیید در برابر انطباق» (Verification-vs.-Conformance Gap) در ایجنتهای هوشمند اشاره کردهاند.
مشکل اینجاست: مدلهای زبانی مانند Claude Haiku هنگام حل یک مسئله، کتابخانههای نرمافزاری میسازند که در ظاهر درست کار میکنند، اما در تستهای دقیقتر (خارج از محیطِ جلسه اصلی)، نرخ خطای بسیار بالایی دارند. این یعنی سیستم، «تکمیل وظیفه» را تأیید میکند اما کدی که تولید کرده در درازمدت دچار «پوسیدگی خاموش» میشود.
محققان با معرفی بنچمارک EvolveTool-Bench، راهی برای اندازهگیری این شکاف پیدا کردهاند تا بتوانیم از پایداری ابزارهای ساختهشده توسط هوش مصنوعی در پروژههای واقعی اطمینان حاصل کنیم. دنیای ایجنتها همچنان پر از چالشهای جذاب است! 🤖🛠
نویسی
منبع: arXiv AI
