یکی از چالشهای بزرگ مدلهای استدلالی (Reasoning Models)، طولانی بودن بیش از حد پاسخها و در نتیجه کندی و هزینهی بالای آنهاست.
محققان روش جدیدی به نام QLPO را معرفی کردهاند که بدون نیاز به تغییر در تابع پاداش، به مدل یاد میدهد پاسخهای کوتاهتر اما دقیقتری تولید کند. در این روش، با استفاده از نمونهبرداری هوشمند، پاسخهای صحیحِ کوتاه بر پاسخهای طولانی ترجیح داده میشوند که نتیجه آن کاهش ۳۰ تا ۷۰ درصدی طول پاسخها بدون افت کیفیت است. این یعنی مدلهای آینده هم سریعتر خواهند بود و هم اقتصادیتر! 🧠✨
های_زبانی
منبع: arXiv AI
