تا به حال دقت کردید که مدلهای زبانی در بنچمارکهای استاندارد عالی عمل میکنند اما در دنیای واقعی و گفتگوهای پیچیده، ناگهان دچار خطا میشوند؟ محققان بهتازگی ابزار جدیدی به نام StabilityBench معرفی کردهاند که این مشکل را به چالش میکشد.
این ابزار به جای تستهای تکمرحلهای و ساده، بنچمارکها را به گفتگوهای چندمرحلهای و چالشبرانگیز تبدیل میکند تا رفتارهای متناقض مدلها در مواجهه با ورودیهای نامتعارف (مثل شبیهسازیهای رفتاری کاربران) شناسایی شود. نتیجه؟ بسیاری از مدلهای قدرتمند فعلی در این شرایطِ نزدیک به واقعیت، عملکرد پایداری ندارند.
این یک قدم مهم برای درک محدودیتهای فعلی هوش مصنوعی و حرکت به سمت بنچمارکهای واقعگرایانهتر است. نظر شما چیست؟ آیا هوش مصنوعی بالاخره میتواند در شرایط واقعی و پرهرجومرج، قابلاعتماد شود؟
منبع: arXiv AI
