محققان در پژوهشی جدید، بنچمارکی تحت عنوان «Adversarial Pragmatics» معرفی کردهاند که به چالشهای پیچیده در رفتار مدلهای زبانی میپردازد. این ابزار نه تنها بررسی میکند که آیا هوش مصنوعی دستورات را دنبال کرده، بلکه تفاوت بین عدم توانایی مدل، ابهام در سیاستگذاریها و یا دستورات متناقض را به دقت تحلیل میکند.
این بنچمارک با تمرکز بر مسائلی مثل «دستورات جاسازیشده» و «ابهامات زبانی»، کمک میکند تا بفهمیم مدلها در شرایط واقعی و پیچیده چگونه عمل میکنند و نقاط ضعف ساختار ایمنی آنها دقیقاً کجاست. گام مهمی برای ساخت هوش مصنوعی ایمنتر و قابلاعتمادتر! 🤖✨
منبع: arXiv NLP
