محققان در مطالعهای جدید به یک چالش مهم در مدلهای زبانی بزرگ (LLM) پی بردهاند: «ناپایداری در پاسخدهی». این تحقیق نشان میدهد که بسیاری از مدلها با وجود دقت بالا، وقتی یک سوال را با جملهبندی متفاوت (اما با همان مفهوم) میپرسیم، دچار تناقض میشوند.
نکات کلیدی این پژوهش:
🔹 نرخ خطای پاسخها در تغییر جملهبندی میتواند تا ۲۳٪ برسد!
🔹 دقت بالا در حالت عادی، لزوماً به معنای درک عمیق مدل نیست.
🔹 راهکار پیشنهادی؟ استفاده از استراتژی «خود-پارافریزینگ» (Self-paraphrasing) برای استخراج دانش نهفته مدل که میتواند دقت را در زمان اجرا به طرز چشمگیری بهبود بخشد.
این یافتهها به ما یادآوری میکند که برای ارزیابی واقعی هوش مصنوعی، نباید فقط به بنچمارکهای عددی تکیه کرد.
منبع: arXiv Machine Learning
