محققان در یک پژوهش جدید، رویکردی نوآورانه برای شخصیسازی سطح «حساسیت به محتوای سمی» در مدلهای زبانی معرفی کردند. برخلاف روشهای فعلی که به صورت جهانی (Global) تعیین میکنند چه چیزی سمی یا توهینآمیز است، این روش جدید بدون نیاز به بازآموزی (Retraining) سنگین، مدل را با سلیقه و حساسیتهای شخصی کاربر همسو میکند.
این تحقیق با بررسی سه مرحله مداخله (قبل، حین و بعد از تولید متن)، نشان داده که میتوان خطای تطبیق محتوا را بین ۲۸ تا ۴۷ درصد کاهش داد. این یعنی آینده مدلهای هوش مصنوعی بهگونهای خواهد بود که دقیقاً بر اساس چارچوبهای اخلاقی و فکری هر فرد، خروجیهای امن و مناسب تولید کنند. البته چالش اصلی همچنان ایجاد تعادل بین این شخصیسازی و کیفیت کلی زبان مدل است.
منبع: arXiv NLP


