🚀 جهشی بزرگ در آموزش مدل‌های زبانی با معرفی GFlowRL

⚠️ هشدار به محققان: چرا دقت مدل‌های شناسایی پهپاد گاهی «واقعی» نیست؟

محققان در مقاله‌ای جدید، الگوریتم نوآورانه «GFlowRL» را معرفی کرده‌اند که می‌تواند جایگزین روش‌های سنتی یادگیری تقویتی (RL) در مدل‌های بزرگ زبانی شود. این متد با حذف شبکه کمکی پیچیده برای تخمین توزیع‌ها، ثبات مدل را افزایش داده و در بنچمارک‌های کدنویسی و ایمنی، رکوردهای خیره‌کننده‌ای (در حد مدل o3-mini) ثبت کرده است. این یعنی مسیر تازه‌ای برای ساخت مدل‌هایی که هم دقیق‌تر فکر می‌کنند و هم کمتر دچار خطاهای امنیتی می‌شوند. 🧠✨

منبع: arXiv Machine Learning