محققان روش جدیدی به نام O2-CritiCuRL معرفی کردهاند که مشکل رایج مدلهای زبانی چندوجهی را حل میکند؛ این مدلها گاهی به پاسخ درست میرسند اما مسیر استدلالشان اشتباه یا غیرمنطقی است.
این فریمورک با استفاده از یک رویکرد یادگیری تقویتی (RL) دو مرحلهای، مراحل «حیاتی» استدلال را از مراحل اضافی جدا میکند. نتیجه این کار، افزایش دقت در حل مسائل پیچیده و بهبود چشمگیر سرعت آموزش و استنتاج مدلهاست.
اگر در حوزه طراحی معماری مدلهای هوش مصنوعی فعال هستید، بررسی کدهای این پروژه در گیتهاب میتواند بسیار الهامبخش باشد.
🔗 لینک پروژه: https://github.com/kk0013/CritiCuRL
منبع: arXiv AI
