محققان در تازهترین دستاورد خود، روشی انقلابی به نام SLPO (مخفف Surrogate Latent Policy Optimization) را معرفی کردهاند که نحوه استدلال مدلهای هوش مصنوعی را متحول میکند.
💡 ماجرا چیست؟
مدلهای فعلی برای استدلال (Chain-of-Thought)، از کلمات استفاده میکنند که بسیار هزینهبر و کند است. روش جدید SLPO به مدلها اجازه میدهد به جای کلمات، از «بردارهای پیوسته» برای استدلال درونی استفاده کنند. این یعنی:
✅ کاهش چشمگیر هزینههای محاسباتی
✅ افزایش دقت در حل مسائل پیچیده
✅ تخصیص هوشمندانه زمان پردازش به مسائل سختتر
این تکنیک راه را برای مدلهای آینده باز میکند تا سریعتر، دقیقتر و «عمیقتر» فکر کنند! 🧠⚡️
منبع: arXiv Machine Learning
