تا به حال فکر کردید چطور میتوان کدهای برنامهنویسی را به جای فقط «صحیح بودن»، «سریعتر» کرد؟ محققان در یک دستاورد جدید، مدلهای زبانی را آموزش دادند تا با استفاده از یادگیری تقویتی (RL)، کدهای بهینهتری تولید کنند.
چالش اصلی در این کار، نویز موجود در زمان اندازهگیری اجرای کد و ناپایداری مدل بود، اما این پژوهش با معرفی راهکارهایی مثل «شبیهساز آفلاین» و بهبود الگوریتم GRPO، موفق شد کارایی مدلهایی مثل Qwen 2.5 را به طرز چشمگیری افزایش دهد.
نتایج فوقالعاده است: بهبود بیش از ۱۰۰ درصدی در سرعت اجرای کدها بدون قربانی کردن دقت! این یعنی در آینده نه چندان دور، هوش مصنوعی برنامهنویس میتواند کدهایی بنویسد که نه تنها درست کار میکنند، بلکه در محیطهای اجرایی با سرعت بسیار بالاتری اجرا میشوند. 💻⚡
منبع: arXiv AI
