در دنیای یادگیری تقویتی (RL)، تصور عمومی این است که برای رسیدن به نتایج بهتر، باید Q-function را هم مانند سیاستهای پایه (Policies) پیشآموزش دهیم. اما یک تحقیق جدید در آرکایو نشان داده که این باور لزوماً درست نیست! 📉
محققان متوجه شدند که پیشآموزشِ متداول Q-function، اغلب در مرحله فاینتیونینگ (Fine-tuning) آنلاین تاثیر چندانی ندارد. آنها برای حل این مشکل، متد جدیدی به نام IPE (Initialization via Policy Ensemble) معرفی کردند که با استفاده از مجموعهای از سیاستهای متنوع، یادگیری Q-function را به شکل بهینهتری تقویت میکند. این روش در تستهای کنترل پیوسته، عملکرد بسیار بهتری نسبت به روشهای سنتی نشان داده است. 🚀
منبع: arXiv Machine Learning
