محققان در مطالعه جدیدی، تکنیک نوآورانهای به نام «On-Policy Delta Distillation» یا به اختصار OPD² ارائه کردهاند که نحوه آموزش و بهینهسازی مدلهای زبانی (LLMs) را متحول میکند.
🔹 این روش چیست؟
در متدهای معمول، مدلها سعی میکنند از خروجی نهایی مدلهای بزرگتر تقلید کنند. اما در این روش جدید، تمرکز روی «سیگنال دلتا» است؛ یعنی تفاوت بین مدل پایه و مدل آموزشدیده برای استدلال. این کار باعث میشود مدلهای هوش مصنوعی خیلی سریعتر و دقیقتر، توانمندیهای منطقی، ریاضی و کدنویسی را یاد بگیرند.
این یعنی در آیندهای نزدیک، مدلهای کوچکتر با زمان آموزش کوتاهتر، در حل مسائل پیچیده عملکردی به مراتب بهتر خواهند داشت.
منبع: arXiv Machine Learning
