یکی از چالشهای بزرگ در آموزش مدلهای زبانی (LLM)، گیر افتادن مدل در راهحلهای تکراری یا همان «Mode Collapse» است. محققان به تازگی چارچوب نوآورانهای به نام PPO-HSC را معرفی کردهاند که با استفاده از «پوشش نمونهبرداری مرتبه بالا»، مدل را تشویق میکند تا به جای تکرارِ مسیرهای امن و همیشگی، به دنبال راهحلهای جدید و خلاقانه اما معتبر بگردد.
این روش که در حل مسائل پیچیده ریاضی و تولید کد بسیار موفق عمل کرده، باعث میشود هوش مصنوعی در زمان استدلال، قدرت اکتشاف بیشتری داشته باشد و از «کلیشهسازی» در پاسخها فاصله بگیرد. پیشرفت بزرگی برای مدلهایی که میخواهند فراتر از تقلید، واقعاً فکر کنند! 💡
منبع: arXiv AI
