تا به حال فکر کردهاید که چرا مدلهای هوش مصنوعی در محیطهای واقعی و کاری گاهی دچار اشتباهات عجیب میشوند؟ محققان بهتازگی بنچمارک جدیدی به نام «SQBench» را معرفی کردهاند که دقیقاً روی همین نقطه ضعف دست گذاشته است!
نکته کلیدی اینجاست: بیشتر بنچمارکهای فعلی فقط دانش یا کدنویسی مدل را میسنجند، اما SQBench بررسی میکند که آیا هوش مصنوعی میتواند در یک فرآیند کاری واقعی، خروجی بدون خطا، ایمن و کاربردی تحویل دهد یا خیر.
نتایج جالب این گزارش:
✅ در سناریوهای پیچیده تجاری (L3)، عملکرد مدلها بهشدت افت میکند.
✅ بررسی ۲۷ مدل نشان داد که حتی وقتی هوش مصنوعی «کار را تمام میکند»، در ۴.۸٪ مواقع به دلیل خطراتی مثل استنادهای غیرواقعی یا رعایت نکردن فرمتها، عملاً غیرقابل استفاده است!
این ابزار جدید به ما کمک میکند بفهمیم هوش مصنوعی کجا واقعاً برای بیزینسها آماده است و کجا هنوز باید روی آن کار کرد.
منبع: arXiv AI
