تا حالا فکر کردید مدلهای زبانی تا چه حد میتوانند در حل مسائل پیچیده و چندمرحلهای مثل «محاسبات ارث» دقیق باشند؟ یک تحقیق جدید در رقابت QIAS 2026 نشان داده که هنوز بین مدلهای تجاری و متنباز (Open-source) فاصله معناداری وجود دارد.
نتایج جالب این پژوهش:
🔹 مدلهای تجاری در تشخیص وارثان و اجرای قوانین حذف، بسیار قابلاعتمادتر عمل میکنند.
🔹 مدلهای متنباز در محاسبات дроб (کسری) و تصمیمات حقوقی وابسته، با بیثباتی بیشتری روبرو هستند.
🔹 در صدر این لیست، مدل قدرتمند «Gemini 2.5 Flash» با کمترین ضریب خطا (MRE) خوش درخشیده است.
این تحقیق ثابت میکند که برای کارهای حساس و محاسباتیِ حقوقی، هنوز راه زیادی تا جایگزینی کامل مدلهای متنباز با غولهای تجاری باقی مانده است. نظر شما چیست؟ آیا هوش مصنوعی میتواند به یک مشاور حقوقی قابل اعتماد تبدیل شود؟
منبع: arXiv NLP
