محققان در یک پژوهش جدید، چالش جالبی را در مدلهای زبانی بررسی کردهاند: تفاوت بین «درستی واقعی» (Objective Correctness) و «خودقضاوتی» (Self-Judgement) مدلها.
نکته کلیدی مقاله این است که وقتی مدلها سعی میکنند درستی خروجی خود را ارزیابی کنند، اغلب به جای واقعیت، بر اساس «اعتقاد درونی» خود قضاوت میکنند. این یعنی مدل ممکن است با اطمینان کامل، پاسخی نادرست بدهد صرفاً چون با ساختار استدلالی خودش همخوانی دارد! این مطالعه نشان میدهد که تشخیصِ «حقیقت» در مدلهای هوش مصنوعی هنوز راه درازی در پیش دارد و ابزارهای فعلی ما ممکن است فقط همان باورهای درونی مدل را تقویت کنند. 🧠💡
منبع: arXiv Machine Learning
