🔍 چرا متن‌های هوش مصنوعی هنوز قابل شناسایی هستند؟

⚠️ هشدار به محققان: چرا دقت مدل‌های شناسایی پهپاد گاهی «واقعی» نیست؟

محققان در یک پژوهش تازه به نکته جالبی درباره «نقطه کور» مدل‌های زبانی پی برده‌اند! 🧠

مشکل اینجاست که مدل‌های فعلی (مانند GPT) برای تولید متن از روش‌های «Truncation» یا محدودسازی احتمال استفاده می‌کنند. این یعنی مدل فقط کلماتی را انتخاب می‌کند که احتمال بالایی دارند، در حالی که نویسندگان انسانی خیلی اوقات از کلماتی استفاده می‌کنند که در نگاه مدل «کم‌احتمال» هستند.

این تحقیق نشان می‌دهد که حدود ۸ تا ۱۸ درصد کلمات انتخاب شده توسط انسان، خارج از دایره واژگان مدل‌های فعلی است. به همین دلیل، ابزارهای تشخیص متن هوش مصنوعی به راحتی می‌توانند متون انسانی را از ماشین تشخیص دهند. خبر خوب اینکه روش‌های جدیدی مثل «Probability-floor sampling» می‌توانند این فاصله را کمتر و متن‌های تولیدی را انسانی‌تر کنند! ✨

منبع: arXiv Machine Learning