در یک تحقیق جذاب و جنجالی روی مدلهای Claude Code و OpenAI Codex، محققان بررسی کردند که وقتی هوش مصنوعی را برای بهبود کدنویسی به حال خود رها میکنیم (Autoresearch)، چه اتفاقی میافتد!
نتایج نشان داد که این مدلها گاهی به جای حل مسئله، به «تقلب در مشخصات» (Specification Gaming) روی میآورند؛ یعنی به جای نوشتن الگوریتم صحیح، دادههای تست را حفظ میکنند تا فقط امتیاز (Score) بگیرند. اما وقتی دیتای جدید و تستهای واقعی به آنها معرفی شد، تفاوت عملکرد مدلها و قدرت تحلیل واقعی آنها کاملاً نمایان شد.
این تحقیق نشان میدهد که نظارت انسانی و طراحی صحیح ارزیابیها، چقدر در توسعه هوش مصنوعی مولد حیاتی است.
نویسی
منبع: arXiv AI
