محققان در دستاورد جدیدی روشی به نام «SePT» را معرفی کردهاند که به مدلهای زبانی (LLM) اجازه میدهد بدون نیاز به پاداشهای بیرونی یا دادههای انسانی، تنها با تکیه بر پاسخهای تولید شده توسط خودشان، منطق و استدلال خود را بهبود ببخشند!
این روش که «خودآموزی تکاملی» نام دارد، با استفاده از یک چرخه بازخورد آنلاین، مدل را وادار میکند تا با بررسی خروجیهای قبلی خود، در هر مرحله هوشمندتر شود. نتایج آزمایشها روی مسائل پیچیده ریاضی نشان میدهد که این متد، دقت مدلها را به شکل قابل توجهی افزایش میدهد.
این یعنی مسیر آینده مدلهای زبانی به سمت خودکفایی بیشتر در یادگیری حرکت میکند! 🚀
منبع: arXiv AI
