آیا مدلهای زبانی در حل مسائل پیچیده و چندمحدودیتی (Multi-constraint planning) ناتوان هستند؟ مدلهای فعلی یا در استدلال متنی دچار اشتباه میشوند یا با کدهای بیرویه، کارایی خود را از دست میدهند. 📉
محققان بهتازگی فریمورک قدرتمند SCOPE را معرفی کردهاند که با جداسازی «استدلال» از «اجرای کد»، تحولی در این زمینه ایجاد کرده است. نتایج خیرهکننده است: در بنچمارک TravelPlanner، این سیستم توانسته موفقیت را به ۹۳.۱٪ برساند، در حالی که هزینههای پردازشی را ۱.۴ برابر کاهش و سرعت را بیش از ۴ برابر افزایش داده است! ⚡️
این ابزار نه تنها دقیقتر است، بلکه کدهای تولید شده توسط آن قابل استفاده مجدد در مسائل مشابه هستند.
ریزی
منبع: arXiv AI
