محققان چارچوب جدیدی به نام «Dr. Zero» معرفی کردهاند که به مدلهای جستجوگر اجازه میدهد بدون نیاز به دادههای انسانی یا آموزشی، خود را ارتقا دهند.
نکته کلیدی اینجاست: این مدلها از طریق یک چرخه بازخورد بین دو عامل (Proposer و Solver) یاد میگیرند که چطور مسائل پیچیدهتر را حل کنند. علاوه بر این، روشی جدید به نام HRPO برای کاهش مصرف منابع محاسباتی ابداع شده که کارایی آموزش را به شدت افزایش میدهد.
این یعنی در آیندهای نزدیک، نیاز به مجموعهدادههای عظیم و پرهزینه کمتر خواهد شد و مدلها میتوانند هوشمندانهتر و مستقلتر رشد کنند. 🚀
منبع: arXiv AI
