یکی از چالشهای بزرگ هوش مصنوعی، خطاهای قانونی یا همان «توهمات حقوقی» است. ابزار جدیدی به نام LitigationBench معرفی شده که بهطور اختصاصی برای سنجش عملکرد مدلهای زبانی در وظایف حقوقی و قضایی طراحی شده است.
نتایج اولیه این بررسی نشان میدهد که مدلهای Anthropic (به جز Haiku) در این تستها عملکرد خیرهکنندهای داشتهاند و هیچگونه سندی را جعل یا دچار توهم نکردهاند. این بنچمارک کمک میکند تا دقت هوش مصنوعی در درک پیشفرضها و متون حقوقی دقیقتر از قبل ارزیابی شود.
منبع: Hacker News AI