🔍 چطور دقت و عدم قطعیت مدل‌های زبانی بزرگ (LLM) را دقیق‌تر بسنجیم؟

⚠️ هشدار به محققان: چرا دقت مدل‌های شناسایی پهپاد گاهی «واقعی» نیست؟

محققان به‌تازگی بنچمارک جدیدی به نام «SALT» معرفی کرده‌اند که گامی مهم در ارزیابی دقیق‌تر هوش مصنوعی است. مشکل اینجاست که وقتی مدل‌های زبانی متن‌های طولانی تولید می‌کنند، تشخیص خطاهای کوچک و ارزیابی میزان «عدم قطعیت» (Uncertainty) آن‌ها بسیار چالش‌برانگیز است.

بنچمارک SALT با استفاده از ۶ تسک عملیاتی و متون مرجع دقیق (Deterministic Ground Truth)، امکان ارزیابی مدل‌ها را در سطح «اتمیک» (کلمه به کلمه) فراهم می‌کند. این ابزار به ما نشان داد که چرا رتبه‌بندی اعتماد مدل‌ها در مقیاس‌های کوچک‌تر دچار اختلال می‌شود و چگونه می‌توانیم با مداخله در فرآیند تولید متن، از خطاهای آتی جلوگیری کنیم.

این تحقیق نشان می‌دهد که تقویت قدرت استدلال (مانند روش Chain-of-Thought) یک بده‌بستان (Trade-off) جالب ایجاد می‌کند: دقت بالاتر می‌رود اما اعتماد مدل به پاسخ‌های خودش تغییر می‌کند! 💡

منبع: arXiv AI