محققان در یک دستاورد پژوهشی جدید، الگوریتم هوشمند «Branching Policy Optimization» یا همان BPO را برای آموزش هوش مصنوعی معرفی کردهاند.
💡 نکته کلیدی این روش چیست؟
برخلاف روشهای سنتی که برای آموزش مدلهای زبانی (LLM) به صورت شاخههای مستقل عمل میکردند، BPO از ویژگی «سندباکسهای قابل اسنپشات» استفاده میکند. این یعنی هوش مصنوعی حالا میتواند به جای طی کردن مسیرهای تکراری، از نقاط تصمیمگیری حساس انشعاب بگیرد و با کارایی بسیار بالاتر و واریانس کمتر، فرآیند یادگیری و حل مسائل پیچیده (مانند کدنویسی و محیطهای وب) را انجام دهد.
نتایج آزمایشها نشان میدهد که این متد توانسته نرخ موفقیت مدلهایی مثل Qwen و Llama را در بنچمارکهای دشوار به شکل قابل توجهی بهبود ببخشد.
منبع: arXiv Machine Learning
