🧠 تکنیک جدید برای افزایش قدرت استدلال مدل‌های زبانی: Latent Reward Steering

⚠️ هشدار به محققان: چرا دقت مدل‌های شناسایی پهپاد گاهی «واقعی» نیست؟

محققان در یک دستاورد جدید، فریم‌ورک «Latent Reward Steering» یا به اختصار LRS را معرفی کرده‌اند که می‌تواند دقت استدلال مدل‌های زبانی (LLMs) را در زمان اجرا به شکل چشم‌گیری بهبود بخشد.

🔹 این یعنی چه؟
به جای اینکه فقط به دانشِ از پیش آموزش‌دیده مدل تکیه کنیم، این روش به مدل کمک می‌کند در حین فکر کردن، «رفتارهای شناختی» درست‌تری را انتخاب کند. این سیستم با استفاده از پاداش‌های نهفته (Latent Rewards)، وضعیت‌های ضعیفِ مدل در حین حل مسئله را شناسایی کرده و آن‌ها را اصلاح می‌کند تا خروجی نهایی دقیق‌تر و منطقی‌تر باشد.

این یعنی مدل‌های هوش مصنوعی حالا یاد می‌گیرند قبل از رسیدن به پاسخ نهایی، مسیر استدلال خود را بهینه‌تر کنند.

🔗 دسترسی به کد پروژه

‌های_زبانی

منبع: arXiv AI