محققان بهتازگی بنچمارک جدیدی به نام «SALT» معرفی کردهاند که گامی مهم در ارزیابی دقیقتر هوش مصنوعی است. مشکل اینجاست که وقتی مدلهای زبانی متنهای طولانی تولید میکنند، تشخیص خطاهای کوچک و ارزیابی میزان «عدم قطعیت» (Uncertainty) آنها بسیار چالشبرانگیز است.
بنچمارک SALT با استفاده از ۶ تسک عملیاتی و متون مرجع دقیق (Deterministic Ground Truth)، امکان ارزیابی مدلها را در سطح «اتمیک» (کلمه به کلمه) فراهم میکند. این ابزار به ما نشان داد که چرا رتبهبندی اعتماد مدلها در مقیاسهای کوچکتر دچار اختلال میشود و چگونه میتوانیم با مداخله در فرآیند تولید متن، از خطاهای آتی جلوگیری کنیم.
این تحقیق نشان میدهد که تقویت قدرت استدلال (مانند روش Chain-of-Thought) یک بدهبستان (Trade-off) جالب ایجاد میکند: دقت بالاتر میرود اما اعتماد مدل به پاسخهای خودش تغییر میکند! 💡
منبع: arXiv AI
