تا به حال فکر کردهاید که چرا دو مدل هوش مصنوعی که در ظاهر عملکرد مشابهی دارند، پس از آموزشهای تکمیلی (Post-training) رفتارهای کاملاً متفاوتی از خود نشان میدهند؟ محققان در پژوهش جدیدی به این نتیجه رسیدهاند که «مرحله نهایی پیشآموزش» نقشی حیاتی و پنهان در شکلدهی به آینده مدل دارد.
نتایج این تحقیق نشان میدهد که حتی تغییرات بسیار کوچک در دادههای نهاییِ پیشآموزش، میتواند نحوه یادگیری مدل در مراحل بعدی (مانند DPO یا RL) را بهکلی تغییر دهد. این یعنی برای ساخت مدلهای ایمنتر و دقیقتر، فقط معیارهای سنتی کافی نیست و باید به «اثر انگشت» دادههای پیشآموزش توجه ویژهای داشت. 🧠⚙️
منبع: arXiv AI



