🧠 آیا می‌دانستید اعتماد به نفس مدل‌های زبانی در حین فکر کردن تغییر می‌کند؟

⚠️ هشدار به محققان: چرا دقت مدل‌های شناسایی پهپاد گاهی «واقعی» نیست؟

محققان در یک پژوهش جدید، روشی نوآورانه برای ارزیابی «اعتماد به نفس» مدل‌های زبانی (LLMs) در مراحل مختلف استدلال معرفی کرده‌اند. این مطالعه نشان می‌دهد که روش‌های مختلفِ پس‌از‌آموزش (مثل SFT، RL و OPD) هر کدام در بخش متفاوتی از فرآیند زنجیره فکر (CoT) قابل‌اعتمادتر هستند.

نکته کلیدی این تحقیق، معرفی استراتژی «PosConf» است؛ این روش با استفاده هوشمندانه از بازه‌های زمانیِ قابل‌اطمینان در حین تولید پاسخ، دقت مدل‌ها را در حل مسائل ریاضی تا ۶.۱ واحد بهبود می‌دهد. به عبارت ساده‌تر، مدل‌ها یاد می‌گیرند که کجا باید به پاسخ خود مطمئن باشند و کجا نباید به آن اعتماد کنند!

این پیشرفت می‌تواند به پایداری بیشتر مدل‌ها در کاربردهای حساس کمک بزرگی کند.

منبع: arXiv NLP