محققان در مقالهای جدید، روشی نوآورانه به نام «Distilled RL» را معرفی کردهاند که یادگیری تقویتشده (RL) و تقطیر (Distillation) را با هم ترکیب میکند تا مدلهای هوش مصنوعی بتوانند بهتر از همیشه دانش را از مدلهای قویتر بیاموزند.
💡 چرا این خبر مهم است؟
در روشهای فعلی، مدلهای دانشآموز اغلب در یادگیری دانش جدید از معلم خود دچار مشکل میشوند. این متد جدید با استفاده از «راهنماییهای دقیقتر»، یادگیری را هدفمندتر کرده و عملکرد مدلها را در تستهای استدلالی بهطور چشمگیری افزایش میدهد.
این تحقیق گامی مهم در جهت بهینهسازی دقیقتر (Post-training) مدلهای زبانی بزرگ است تا نه تنها در کپیبرداری از معلم، بلکه در یادگیری مهارتهای جدید نیز هوشمندتر عمل کنند.
منبع: arXiv AI
