آیا هوش مصنوعی واقعاً منطق برنامهنویسی را میفهمد یا فقط کد تولید میکند؟ محققان با معرفی بنچمارک جدید «TLA+-Bench»، یک قدم بزرگ برای پاسخ به این سوال برداشتهاند.
تفاوت اصلی این بنچمارک با مدلهای قبلی این است که به جای مقایسه متنمحور، از «مدلچکر» برای اجرای عملی مشخصات TLA+ استفاده میکند. نتایج نشان میدهد که تفاوت بین «کدِ معتبر» و «کدِ درست» بسیار زیاد است و اکثر مدلها با وجود تولید کدهای قابلاجرا، در درک منطقِ دقیق شکست میخورند. این ابزار به توسعهدهندگان کمک میکند تا واقعیتر از همیشه توانایی استدلال مدلهای زبانی را بسنجند. 🤖💻
نویسی
منبع: arXiv AI
