تا امروز فکر میکردیم مدلهای هوش مصنوعی با طولانیتر نوشتن (Chain-of-Thought)، بهتر استدلال میکنند، اما تحقیقات جدید نشان داده که طولانی نوشتن همیشه به معنی باهوشتر بودن نیست و گاهی فقط «پُرگویی» است! 🧐
محققان در این پژوهش مفهوم «توکنهای تفکر عمیق» (Deep-thinking tokens) را معرفی کردهاند. آنها متوجه شدند مدلهایی که توکنهایشان در لایههای عمیقتر شبکه تغییرات بیشتری دارند، استدلالهای دقیقتری ارائه میدهند. بر همین اساس، استراتژی جدیدی به نام Think@n ابداع شده که اجازه میدهد مدلها با صرف هزینه کمتر و دقت بالاتر، پاسخهای بهتری تولید کنند.
این یعنی پایانِ دورانِ صرفِ طولانینویسی و شروعِ دورانِ هوشمندانهتر فکر کردن مدلهای هوش مصنوعی! ✨
منبع: arXiv NLP
