محققان در یک پژوهش تازه به نکته جالبی درباره «نقطه کور» مدلهای زبانی پی بردهاند! 🧠
مشکل اینجاست که مدلهای فعلی (مانند GPT) برای تولید متن از روشهای «Truncation» یا محدودسازی احتمال استفاده میکنند. این یعنی مدل فقط کلماتی را انتخاب میکند که احتمال بالایی دارند، در حالی که نویسندگان انسانی خیلی اوقات از کلماتی استفاده میکنند که در نگاه مدل «کماحتمال» هستند.
این تحقیق نشان میدهد که حدود ۸ تا ۱۸ درصد کلمات انتخاب شده توسط انسان، خارج از دایره واژگان مدلهای فعلی است. به همین دلیل، ابزارهای تشخیص متن هوش مصنوعی به راحتی میتوانند متون انسانی را از ماشین تشخیص دهند. خبر خوب اینکه روشهای جدیدی مثل «Probability-floor sampling» میتوانند این فاصله را کمتر و متنهای تولیدی را انسانیتر کنند! ✨
منبع: arXiv Machine Learning
