محققان در تازهترین پژوهش خود، با شناسایی یک چالش ساختاری در مدلهای ترنسفورمر به نام «کوری بازخورد» (Feedback-Blindness)، راهحل هوشمندانهای به نام UAT یا «ترنسفورمر تقویتشده با مطلوبیت» (Utility-Augmented Transformer) ارائه دادهاند.
این مدل جدید به ترنسفورمرها اجازه میدهد که در محیطهای پیچیده و غیرایستا، بازخوردهای پاداش و تنبیه را بهتر در فرآیند یادگیری و تصمیمگیری خود ادغام کنند. در واقع، UAT به جای تکیه صرف بر شباهتهای ظاهری مشاهدات، مستقیماً از تاریخچه نتایج اقدامات برای بهبود بازخوردها استفاده میکند. این دستاورد میتواند تحولی در حوزههایی مثل پزشکی (درمان بیماریها)، تخصیص پورتفوی مالی و ناوبریهای خودکار ایجاد کند. 📈✨
منبع: arXiv Machine Learning
