محققان در تازهترین پژوهش خود به بررسی جالبی در مورد «تقطیر خودکارِ تقویتشده با بازخورد» (FA-SD) پرداختهاند. این مطالعه نشان میدهد که چرا مدلهای زبانی هنگام انجام وظایف پیچیده در قالب عاملهای جستجوگر (Search Agents)، با پدیدهای به نام «فروپاشی رمزگشایی» (Decoding Collapse) مواجه میشوند.
در این وضعیت، مدل به جای حل مسئله، صرفاً الگوهای تکراری تولید میکند که اگرچه متنوع به نظر میرسند، اما در واقع هیچ ارتباطی با پرسش اصلی ندارند! محققان برای رفع این مشکل و ایجاد ثبات در یادگیری، استفاده از «میانگین متحرک نمایی» (EMA) را به عنوان راهکار پیشنهادی برای بهبود کیفیت سیگنالهای نظارتی ارائه دادهاند.
این تحقیق گامی مهم برای افزایش دقت مدلهای خودمختار و جلوگیری از خطاهای پنهان در آموزش آنهاست. 🤖💡
منبع: arXiv AI
