🚀 چرا هوش مصنوعی در شرایط واقعی گیج می‌شود؟ معرفی StabilityBench! 🧠

🧠 چرا هوش مصنوعی گاهی «خیالات» می‌بیند؟

تا به حال دقت کردید که مدل‌های زبانی در بنچمارک‌های استاندارد عالی عمل می‌کنند اما در دنیای واقعی و گفتگوهای پیچیده، ناگهان دچار خطا می‌شوند؟ محققان به‌تازگی ابزار جدیدی به نام StabilityBench معرفی کرده‌اند که این مشکل را به چالش می‌کشد.

این ابزار به جای تست‌های تک‌مرحله‌ای و ساده، بنچمارک‌ها را به گفتگوهای چندمرحله‌ای و چالش‌برانگیز تبدیل می‌کند تا رفتارهای متناقض مدل‌ها در مواجهه با ورودی‌های نامتعارف (مثل شبیه‌سازی‌های رفتاری کاربران) شناسایی شود. نتیجه؟ بسیاری از مدل‌های قدرتمند فعلی در این شرایطِ نزدیک به واقعیت، عملکرد پایداری ندارند.

این یک قدم مهم برای درک محدودیت‌های فعلی هوش مصنوعی و حرکت به سمت بنچمارک‌های واقع‌گرایانه‌تر است. نظر شما چیست؟ آیا هوش مصنوعی بالاخره می‌تواند در شرایط واقعی و پرهرج‌ومرج، قابل‌اعتماد شود؟

منبع: arXiv AI