🧠 آیا پیش‌آموزش Q-function در یادگیری تقویتی واقعاً ضروری است؟

🧠 چرا هوش مصنوعی گاهی «خیالات» می‌بیند؟

در دنیای یادگیری تقویتی (RL)، تصور عمومی این است که برای رسیدن به نتایج بهتر، باید Q-function را هم مانند سیاست‌های پایه (Policies) پیش‌آموزش دهیم. اما یک تحقیق جدید در آرکایو نشان داده که این باور لزوماً درست نیست! 📉

محققان متوجه شدند که پیش‌آموزشِ متداول Q-function، اغلب در مرحله فاین‌تیونینگ (Fine-tuning) آنلاین تاثیر چندانی ندارد. آن‌ها برای حل این مشکل، متد جدیدی به نام IPE (Initialization via Policy Ensemble) معرفی کردند که با استفاده از مجموعه‌ای از سیاست‌های متنوع، یادگیری Q-function را به شکل بهینه‌تری تقویت می‌کند. این روش در تست‌های کنترل پیوسته، عملکرد بسیار بهتری نسبت به روش‌های سنتی نشان داده است. 🚀

منبع: arXiv Machine Learning