ابزارهای فعلی تعدیل محتوا (Moderation) در تشخیص متنهای چندزبانه، دارای «کد-میکس» (ترکیب زبانها) یا عامیانه دچار ضعفهای جدی هستند. در پژوهش جدیدی، محققان مدل جدیدی به نام ToxGate را معرفی کردهاند که به جای اعتماد کورکورانه به خروجی ابزارهای جانبی، آنها را به عنوان «شواهد مشروط» تحلیل میکند.
این مدل با استفاده از یک معماری «تراست-فیوژن»، میزان اعتبار سیگنالهای سمی را بر اساس بافتار متن میسنجد و در تستهای انجام شده، عملکرد بسیار دقیقتری در شناسایی فحاشیهای صریح و تهدیدات خشن داشته است. این پیشرفت گام بزرگی برای سالمتر کردن فضای مجازی به کمک هوش مصنوعی محسوب میشود.
منبع: arXiv AI
