محققان در یک دستاورد جدید، فریمورک «Latent Reward Steering» یا به اختصار LRS را معرفی کردهاند که میتواند دقت استدلال مدلهای زبانی (LLMs) را در زمان اجرا به شکل چشمگیری بهبود بخشد.
🔹 این یعنی چه؟
به جای اینکه فقط به دانشِ از پیش آموزشدیده مدل تکیه کنیم، این روش به مدل کمک میکند در حین فکر کردن، «رفتارهای شناختی» درستتری را انتخاب کند. این سیستم با استفاده از پاداشهای نهفته (Latent Rewards)، وضعیتهای ضعیفِ مدل در حین حل مسئله را شناسایی کرده و آنها را اصلاح میکند تا خروجی نهایی دقیقتر و منطقیتر باشد.
این یعنی مدلهای هوش مصنوعی حالا یاد میگیرند قبل از رسیدن به پاسخ نهایی، مسیر استدلال خود را بهینهتر کنند.
های_زبانی
منبع: arXiv AI
