محققان به تازگی بنچمارک جدیدی به نام «WuYu-EnvLE-Bench» را معرفی کردهاند که به طور اختصاصی برای ارزیابی عملکرد مدلهای زبانی بزرگ (LLM) در حوزه «اجرای قوانین محیطزیستی» طراحی شده است.
این تحقیق با بررسی بیش از ۲۵۰۰ مورد واقعی از پروندههای قانونی، نشان میدهد که اگرچه مدلهای هوش مصنوعی در درک قواعد کلی عالی عمل میکنند، اما در زمینههایی مثل «زنجیره استدلال بر اساس شواهد»، تشخیص تناقضات و تصمیمگیریهای پیچیده رویهای هنوز با چالشهای جدی روبرو هستند. این یعنی هنوز نمیتوانیم صفر تا صدِ عدالت در پروندههای زیستمحیطی را به دست هوش مصنوعی بسپاریم!
نکته جالب اینجاست که مدلهای بزرگتر هم همیشه پاسخ بهتری در این حوزههای تخصصی ندارند و نیاز به مدلهای «تخصصگرا» و «مبتنی بر شواهد» به شدت حس میشود.
منبع: arXiv AI
