تا امروز، یکی از چالشهای بزرگ هوش مصنوعی این بود که وقتی یک مدل در مراحل میانیِ حل یک مسئله اشتباه میکرد اما در نهایت به جواب درست میرسید، سخت میشد فهمید کدام قدمش غلط بوده!
محققان حالا متد جدیدی به نام PBSD (مخفف Privileged Bayesian Self-Distillation) معرفی کردهاند. این تکنیک با استفاده از اصول احتمالاتی بیزی، به مدل کمک میکند تا بفهمد کدام «گامهای استدلالی» در طول یک فرآیند طولانی، واقعاً باعث رسیدن به پاسخ درست شدهاند. به زبان ساده، این روش مثل یک معلم دقیق، به مدل یاد میدهد که در هر مرحله از حل مسئله، چقدر اعتبار یا «اعتبار اعتباری» (Credit Assignment) به فعالیتهای خودش بدهد.
این دستاورد میتواند هوش مصنوعیهای جستجوگر و عاملمحور (Agentic AI) را بسیار باهوشتر و دقیقتر کند. 🚀
منبع: arXiv Machine Learning
