محققان در مطالعهای فنی و جذاب، به بررسی گلوگاههای سیستمهای RLHF (یادگیری تقویتی از بازخورد انسانی) پرداختهاند. آنها نشان دادند که نحوه پیادهسازی «Reward Scoring» چقدر میتواند بر سرعت کلی آموزش مدل تأثیرگذار باشد.
نکات کلیدی این پژوهش:
🔹 مقایسه موتورهای استنتاج Native C++ بر پایه ONNX Runtime با ابزارهای رایجی مثل PyTorch Eager و torch.compile.
🔹 نتایج نشان میدهد که در پردازشهای CPU، موتور اختصاصی C++ عملکردی خیرهکننده دارد، اما در GPU، ابزار torch.compile همچنان پیشتاز است.
🔹 نکته مهم: استراتژی دستهبندی (Batching) دادهها تأثیر بسیار بیشتری نسبت به انتخاب زبان برنامهنویسی یا Runtime بر کارایی نهایی دارد.
این تحقیق برای مهندسان MLOps و توسعهدهندگان مدلهای بزرگ که با محدودیتهای زمانی در آموزش دستوپنجه نرم میکنند، بسیار راهگشا است. 🧠💻
نویسی سازی
منبع: arXiv Machine Learning
