محققان در مطالعهای جدید به بررسی این موضوع پرداختهاند که آیا افزایش زمان پردازش (test-time compute) برای مدلهای استدلالگر، میتواند دقت آنها را در نقش «ارزیاب» بهبود ببخشد؟
نتیجه جالب بود: درست مانند مدلهای تولید محتوا، ارزیابهایی که از تکنیک «زنجیره تفکر» (CoT) استفاده میکنند و هر مرحله از پاسخ را جداگانه بررسی میکنند، عملکرد بسیار دقیقتری دارند. این یعنی صرفِ زمان بیشتر برای تحلیلِ پاسخها، میتواند به اندازه استفاده از مدلهای غولپیکر برای تولید، در حل مسائل پیچیده مؤثر باشد! 🧠💡
های_استدلالی
منبع: arXiv NLP
