آیا مدلهای زبانی واقعاً میتوانند «انسجام» داشته باشند؟ پروژه جدید «WorldBuild Bench» با هدف تست درک مدلهای هوش مصنوعی از دنیای سهبعدی و بازیسازی معرفی شده است.
در این بنجمارک، مدلها وظیفه دارند از طریق پرامپتهای مشخص، بازیهای سهبعدی تعاملی بسازند. نکته جالب اینجاست که خروجیها نه با اعداد خشک، بلکه با «مقایسه کور» توسط کاربران ارزیابی میشوند تا کیفیتِ واقعی، گیمپلی و طراحیِ دنیای بازی سنجیده شود. فعلاً مدلهای مختلفی مثل Fable و GPT-5.6 در این میدان رقابت کردهاند تا ببینیم کدام مدل درک بهتری از منطق و تداومِ محیطهای دیجیتال دارد.
به نظر شما، آیا هوش مصنوعی بالاخره میتواند بدون خطاهای عجیب، یک دنیای بازی باثبات خلق کند؟
منبع: Hacker News LLM
