🔍 چالش بزرگ هوش مصنوعی در برنامه‌نویسی: وقتی کدها ظاهر را فریب می‌دهند!

🧠 چرا هوش مصنوعی گاهی «خیالات» می‌بیند؟

دانشمندان در تحقیق جدیدی به سراغ یک مسئله مهم رفته‌اند: مدل‌های هوش مصنوعی گاهی کدی تولید می‌کنند که تست‌های عمومی را با موفقیت پشت سر می‌گذارد، اما همچنان باگ‌های پنهانی دارد که از دید ابزارهای ساده مخفی می‌ماند!

آن‌ها با معرفی پروتکل «Code Monitor Red Teaming» و بنچمارک جدیدی به نام CodeMonitorBench، سعی کردند با استفاده از «ورریفایرهای ضعیف‌تر»، این باگ‌های نهفته را شناسایی کنند. نتایج نشان داد که حتی با مدل‌های پیشرفته هم، عبور از تست‌های عمومی لزوماً به معنای correctness (درستی کامل) کد نیست و هوش مصنوعی هنوز برای رسیدن به دقت ۱۰۰٪ در تولید کد، راه درازی در پیش دارد. 🤖💻

منبع: arXiv AI