دانشمندان در تحقیق جدیدی به سراغ یک مسئله مهم رفتهاند: مدلهای هوش مصنوعی گاهی کدی تولید میکنند که تستهای عمومی را با موفقیت پشت سر میگذارد، اما همچنان باگهای پنهانی دارد که از دید ابزارهای ساده مخفی میماند!
آنها با معرفی پروتکل «Code Monitor Red Teaming» و بنچمارک جدیدی به نام CodeMonitorBench، سعی کردند با استفاده از «ورریفایرهای ضعیفتر»، این باگهای نهفته را شناسایی کنند. نتایج نشان داد که حتی با مدلهای پیشرفته هم، عبور از تستهای عمومی لزوماً به معنای correctness (درستی کامل) کد نیست و هوش مصنوعی هنوز برای رسیدن به دقت ۱۰۰٪ در تولید کد، راه درازی در پیش دارد. 🤖💻
منبع: arXiv AI
