حتماً برایتان پیش آمده که از یک مدل هوش مصنوعی سوالی بپرسید و بخواهید میزان اطمینانش به پاسخ را بداند. اما یک نکته مهم: مقالات تخصصی اخیر نشان میدهند که تکیه بر نمرات اعتماد LLMها میتواند گمراهکننده باشد! 🧐
در بررسیهای فنی جدید مطرح شده که ساختار درونی این مدلها لزوماً به گونهای نیست که بتوانند «درست یا غلط بودن» پاسخ خود را با اعداد به دقت ارزیابی کنند. در واقع، این نمرات اغلب بازتابدهنده واقعیتِ صحتِ پاسخ نیستند و نباید به عنوان یک شاخص دقیق در پروژههای حساس روی آنها حساب باز کرد.
اگر در حال توسعه اپلیکیشنهای هوش مصنوعی هستید، بهتر است به دنبال روشهای اعتبارسنجی (Validation) جایگزین و مطمئنتری باشید.
منبع: Hacker News LLM
