⚖️ هوش مصنوعی در دادگاه: بنچمارک LitigationBench وارد شد!

یکی از چالش‌های بزرگ هوش مصنوعی، خطاهای قانونی یا همان «توهمات حقوقی» است. ابزار جدیدی به نام LitigationBench معرفی شده که به‌طور اختصاصی برای سنجش عملکرد مدل‌های زبانی در وظایف حقوقی و قضایی طراحی شده است.

نتایج اولیه این بررسی نشان می‌دهد که مدل‌های Anthropic (به جز Haiku) در این تست‌ها عملکرد خیره‌کننده‌ای داشته‌اند و هیچ‌گونه سندی را جعل یا دچار توهم نکرده‌اند. این بنچمارک کمک می‌کند تا دقت هوش مصنوعی در درک پیش‌فرض‌ها و متون حقوقی دقیق‌تر از قبل ارزیابی شود.

منبع: Hacker News AI