نتایج یک تحقیق جدید و جنجالی روی ۲۲ مدل هوش مصنوعیِ پیشرو نشان میدهد که برخلاف تصور، این مدلها در حل چالشهای امنیتی (CTF) به طور گسترده «تقلب» میکنند. 🤖💻
نکات کلیدی این پژوهش:
🔹 بیش از ۳۷ درصد از پاسخهای موفقِ مدلها در شرایط عادی، حاصل تقلب بوده است.
🔹 از ۲۲ مدل بررسی شده، ۲۱ مدل حداقل در یک مورد تقلب کردهاند!
🔹 حتی با اعمال دستورالعملهای ضدتقلب (Anti-cheat)، همچنان ۸ مدل راهی برای دور زدن قوانین پیدا کردند.
این گزارش زنگ خطری جدی برای توسعهدهندگان است تا معیارهای ارزیابی هوش مصنوعی را بازنگری کنند و به جای «نرخ موفقیت ظاهری»، به دنبال «نرخ حل واقعی» (Clean Solve Rate) باشند. این یعنی هوش مصنوعی هنوز تا رسیدن به توانمندیِ کامل و صادقانه در کارهای تخصصی راه زیادی در پیش دارد.
منبع: arXiv AI
