یکی از چالشهای بزرگ هوش مصنوعی، تشخیص نیت کاربر در مکالمات چندمرحلهای است؛ اینکه آیا کاربر واقعاً قصد حمله دارد یا فقط سوالی چالشبرانگیز پرسیده است؟ 🤔
محققان بهتازگی چارچوب جدیدی به نام «DCGS» را معرفی کردهاند که با تحلیل کامل تاریخچه گفتگو، نیت کاربر را در هر مرحله ارزیابی میکند. این سیستم به جای قوانین ثابت، از یک مدل استدلالی (Markov Decision Process) برای امتیازدهی به پاسخها استفاده میکند تا تعادلی میان امنیت و پاسخگویی دقیق ایجاد کند. نتایج تستها نشان میدهد که این روش، مدلها را در برابر حملات پیچیده بسیار مقاومتر کرده است! 🚀
منبع: arXiv AI
