محققان در پژوهش جدیدی، روش خلاقانهای به نام DMAPO معرفی کردهاند که به جای استفاده از حجم عظیمی از دادهها، روی «دادههای باکیفیت و مورد توافقِ چندین ارزیاب» تمرکز میکند.
نکات کلیدی این روش:
✅ فیلتر کردن هوشمند: این مدل تنها از ۳.۵ درصد پاسخهای تولید شده استفاده میکند اما دقت و عملکرد نهایی آن به شکل چشمگیری بهبود یافته است.
✅ رقابت با مدلهای بزرگ: نتایج نشان میدهد که این رویکرد دادهمحور، میتواند عملکرد مدلهای کوچکی مثل Mistral-7B را در رقابت با مدلهای قدرتمند بسیار بالا ببرد.
✅ کارایی بیشتر: این روش ثابت میکند که برای آموزش مدلهای زبانی، به جای کمیت، کیفیت و توافقِ ارزیابها اهمیت تعیینکنندهای دارد.
این یافته میتواند مسیر آموزش مدلهای هوش مصنوعی را برای توسعهدهندگان بسیار بهینهتر و سریعتر کند. آیندهی آموزش مدلها به سمت «دادههای طلایی» پیش میرود! ✨
منبع: arXiv AI



