اگر در حوزه توسعه مدلهای برنامهنویسی فعالیت میکنید، یک تحقیق تازه و کاربردی در arXiv منتشر شده که پاسخ جذابی به این سوال میدهد! محققان به بررسی این موضوع پرداختهاند که چگونه کیفیت و تعداد دادههای آموزشی (Trajectories) بر عملکرد مدلهایی مثل Qwen2.5-Coder تاثیر میگذارد.
نتایج کلیدی این پژوهش:
✅ معرفی چارچوبی برای امتیازدهی به کیفیت دادهها بر اساس «بهرهوری» (Efficiency) و «سبک» (Style).
✅ اثبات این که در مقیاسهای کوچک، افزایش داده تاثیر چشمگیری دارد، اما با بزرگتر شدن مدل، «کیفیت» دادهها تعیینکننده اصلی عملکرد است.
✅ شناسایی «نرخ خطای تکرار» به عنوان مهمترین فاکتور در فیلتر کردن دادههای آموزشی برای ایجنتهای هوشمند.
این یافتهها مسیر دقیقتری را برای توسعهدهندگان ایجنتهای خودمختار ترسیم میکند تا به جای بمباران مدل با دادههای خام، روی دادههای باکیفیت تمرکز کنند.
منبع: arXiv AI
