محققان در پژوهشی جدید، رویکردی جذاب برای حل چالش بزرگ مدلهای زبانی (LLM) یعنی «تعادل بین تنوع وظایف و دقت پاسخها» ارائه دادهاند.
این متد که Skill-SP نام دارد، بر پایه یک حلقه یادگیری تقویتی بنا شده و شامل سه بخش اصلی است:
۱. پیشنهاددهنده (Proposer) برای ایجاد چالشها
۲. حلکننده (Solver) برای یافتن راهکارها
۳. کنترلکننده مهارت (Skill Controller) برای مدیریت و گسترش دانش
این سیستم اجازه میدهد مدل به جای آموزشهای سنتی، از طریق بازی با خودش (Self-play) به طور مداوم مهارتهای تخصصی خود را به چالش بکشد و تکامل یابد. این یعنی قدمی بزرگ به سوی مدلهای هوشمندتر با قابلیت استدلال عمیقتر و توانایی بهتر در استفاده از ابزارها! 🧠✨
منبع: arXiv NLP
