مدلهای بزرگ استدلالی (LRMs) برای رسیدن به پاسخ، زنجیرهای طولانی از مراحل فکری (CoT) را طی میکنند که باعث کندی و افزایش هزینهها میشود. اما آیا میتوان این مراحل را به دانشِ درونی مدل تبدیل کرد؟
محققان در مقاله جدیدی روشی به نام «Masked Distillation» را معرفی کردهاند که به مدلهای دانشآموز اجازه میدهد بدون نیاز به نوشتن زنجیرههای فکری طولانی، مستقیماً به پاسخ نهایی برسند. در این روش، مدل یاد میگیرد پاسخ را تولید کند، در حالی که یک مدل «معلم» بازخوردهای لازم را بر اساس استدلالهای خود به او ارائه میدهد. این تکنیک میتواند گامی بزرگ برای بهینهتر و سریعتر کردن پاسخدهی مدلهای هوش مصنوعی باشد! 🧠✨
منبع: arXiv NLP



