در یک آزمایش جالب، محققان در پروژه «TaxCalcBench» توانایی مدل چینی Kimi K3 را برای حل مسائل پیچیده مالیاتی ایالات متحده به چالش کشیدهاند. این بنچمارک بررسی میکند که آیا هوش مصنوعی میتواند قوانین پیچیده مالیاتی را درک و خروجی دقیقی ارائه دهد یا خیر. نتایج این دست ارزیابیها به ما نشان میدهد که مدلهای زبانی تا چه حد در انجام کارهای تخصصی و قانونی قابل اعتماد هستند. 🤖💼
منبع: Hacker News AI
