⚖️ آیا هوش مصنوعی می‌تواند قاضی پرونده‌های محیط‌زیستی باشد؟

⚠️ هشدار به محققان: چرا دقت مدل‌های شناسایی پهپاد گاهی «واقعی» نیست؟

محققان به تازگی بنچمارک جدیدی به نام «WuYu-EnvLE-Bench» را معرفی کرده‌اند که به طور اختصاصی برای ارزیابی عملکرد مدل‌های زبانی بزرگ (LLM) در حوزه «اجرای قوانین محیط‌زیستی» طراحی شده است.

این تحقیق با بررسی بیش از ۲۵۰۰ مورد واقعی از پرونده‌های قانونی، نشان می‌دهد که اگرچه مدل‌های هوش مصنوعی در درک قواعد کلی عالی عمل می‌کنند، اما در زمینه‌هایی مثل «زنجیره استدلال بر اساس شواهد»، تشخیص تناقضات و تصمیم‌گیری‌های پیچیده رویه‌ای هنوز با چالش‌های جدی روبرو هستند. این یعنی هنوز نمی‌توانیم صفر تا صدِ عدالت در پرونده‌های زیست‌محیطی را به دست هوش مصنوعی بسپاریم!

نکته جالب اینجاست که مدل‌های بزرگتر هم همیشه پاسخ بهتری در این حوزه‌های تخصصی ندارند و نیاز به مدل‌های «تخصص‌گرا» و «مبتنی بر شواهد» به شدت حس می‌شود.

منبع: arXiv AI