یکی از چالشهای اصلی در آموزش مدلهای زبانی (LLMs) با یادگیری تقویتی، نحوه تخصیص دقیق امتیاز به تکتک کلمات (Token-level credit assignment) است. محققان به تازگی چارچوب جدیدی به نام ACPO معرفی کردهاند که با استفاده از «آنتروپی جایگزین»، یادگیری مدل را هوشمندتر میکند.
💡 چرا این مهم است؟
مدلهای فعلی معمولاً امتیاز کل یک خروجی را به صورت یکسان به همه کلمات اختصاص میدهند که دقیق نیست. ACPO با تمرکز بر تصمیمات نامطمئن در موفقیتها و شناسایی رفتارهای اشتباه در شکستها، باعث میشود مدل در حل مسائل پیچیده ریاضی و کدنویسی بسیار دقیقتر عمل کند.
این روش در بنچمارکهای مهمی مثل HumanEvalPro توانسته رقبای قدرتمندی مثل DAPO را پشت سر بگذارد. قدمی دیگر برای رسیدن به مدلهایی با استدلال منطقی قویتر! 🧠✨
نویسی
منبع: arXiv AI
