محققان در مقالهای جدید، متد انقلابی «Token-Level Off-Policy Learning» (به اختصار TOPL) را معرفی کردهاند. این روش با تغییر استراتژی آموزش مدلها از «سطح جمله» به «سطح توکن»، به مدل یاد میدهد که تفاوت بین توکنهای درست و غلط را بهتر درک کند.
✨ چرا این خبر مهم است؟
این رویکرد باعث میشود مدلها در وظایفی مثل خلاصهسازی متون و ترجمه ماشینی، بسیار دقیقتر عمل کنند و حتی در دادههایی که قبلاً ندیدهاند (Out-of-distribution)، عملکرد خیرهکنندهای داشته باشند. جالبتر اینکه این روش، بهروزرسانی مدل را برای توسعهدهندگان شفافتر و قابلفهمتر میکند.
به نظر میرسد قدم دیگری در کاهش توهمات (Hallucinations) مدلهای زبانی برداشته شده است!
منبع: arXiv Machine Learning
