یکی از بزرگترین چالشهای مدلهای زبانی (LLM)، «تفسیرپذیری» یا همان توانایی ارائه دلایل منطقی و واقعی برای پاسخهایشان است. محققان به تازگی روش جدیدی را با استفاده از یادگیری تقویتی (RL) معرفی کردهاند که مدل را وادار میکند تا استدلالهایش را «صادقانهتر» و دقیقتر بیان کند.
در این تحقیق، مدلهای Llama3.1-8B و Qwen3-8B آموزش دیدهاند تا به جای پاسخهای مبهم، فرآیند تصمیمگیری درونی خود را بهتر فاش کنند و متوجه فاکتورهایی شوند که مستقیماً روی نتیجه نهایی آنها اثر میگذارد. این دستاورد گام مهمی به سمت ساخت مدلهای هوش مصنوعی شفافتر و قابلاعتمادتر است که میتوانند دلیل «چرا» بودنِ پاسخهای خود را توضیح دهند.
منبع: arXiv AI
