🛡️ پاکسازی محتوای توهین‌آمیز با قدرت LLMها

⚠️ هشدار به محققان: چرا دقت مدل‌های شناسایی پهپاد گاهی «واقعی» نیست؟

محققان در پژوهش جدیدی فریم‌ورک «Detoxify» را معرفی کرده‌اند که هدفش تبدیل متن‌های حاوی توهین و نفرت‌پراکنی به جملات محترمانه است، بدون اینکه معنا و مفهوم اصلی پیام تغییر کند!

در این مطالعه، مدل‌های بزرگی مثل GPT-4o، Gemini، DeepSeek و Groq مورد بررسی قرار گرفتند تا عملکرد آن‌ها در تشخیص و بازنویسی متن‌های سمی سنجیده شود. نتایج نشان می‌دهد که مدل Groq رویکرد متفاوتی دارد و گاهی جملات را با لحن مثبت بیش از حد بازنویسی می‌کند، در حالی که مدل‌هایی مثل GPT-4o و DeepSeek عملکرد مشابهی در حفظ محتوا داشته‌اند.

این فناوری می‌تواند گام مهمی برای داشتن محیط‌های آنلاین سالم‌تر و کم‌تنش‌تر باشد! ✨

منبع: arXiv AI