یکی از بزرگترین چالشهای مدلهای زبانی، توهم یا همان تولید اطلاعات غلط (Hallucination) است. حالا محققان چارچوب جدیدی به نام «Hallucination Self-Play» (HSP) معرفی کردهاند که به جای تکیه بر دادههای انسانی، از یک چرخه رقابتی بین دو مدل استفاده میکند.
در این روش، یک مدل «مولد» تلاش میکند توهمهای پیچیدهتری بسازد و همزمان یک مدل «تشخیصدهنده» سعی میکند این توهمها را شناسایی کند. این رقابت باعث میشود که مدلها بدون نیاز به نظارت انسانی، بهصورت خودکار بهبود یافته و دقت بسیار بالاتری در پاسخهای صادقانه داشته باشند.
این دستاورد میتواند راه را برای ساخت مدلهای زبانی کوچکتر اما بسیار دقیقتر هموار کند.
منبع: arXiv Machine Learning
