📊 معیار جدید برای سنجش دقت هوش مصنوعی در کدنویسی رسمی

🧠 چرا هوش مصنوعی گاهی «خیالات» می‌بیند؟

آیا هوش مصنوعی واقعاً منطق برنامه‌نویسی را می‌فهمد یا فقط کد تولید می‌کند؟ محققان با معرفی بنچمارک جدید «TLA+-Bench»، یک قدم بزرگ برای پاسخ به این سوال برداشته‌اند.

تفاوت اصلی این بنچمارک با مدل‌های قبلی این است که به جای مقایسه متن‌محور، از «مدل‌چکر» برای اجرای عملی مشخصات TLA+ استفاده می‌کند. نتایج نشان می‌دهد که تفاوت بین «کدِ معتبر» و «کدِ درست» بسیار زیاد است و اکثر مدل‌ها با وجود تولید کدهای قابل‌اجرا، در درک منطقِ دقیق شکست می‌خورند. این ابزار به توسعه‌دهندگان کمک می‌کند تا واقعی‌تر از همیشه توانایی استدلال مدل‌های زبانی را بسنجند. 🤖💻

‌نویسی

منبع: arXiv AI