استیون ولفرام و تیمش در پروژه جدید خود به سراغ ارزیابی دقیق و علمی مدلهای زبانی بزرگ (LLM) رفتهاند. در این پروژه، تمرکز بر روی سنجش دقیق توانمندیهای منطقی و محاسباتی مدلهاست تا فراتر از هیاهوی تبلیغاتی، ببینیم هوش مصنوعی واقعاً تا چه حد در حل مسائل پیچیده هوشمند عمل میکند. این یک گام بزرگ برای استانداردسازی ارزیابی هوش مصنوعی است!
منبع: Hacker News LLM
