محققان در مطالعهای جدید، چالش مهمی را در استفاده از مدلهای زبانی (LLM) به عنوان «عامل» (Agent) شناسایی کردهاند. گاهی این مدلها هنگام کار با ابزارها، قوانینی را نقض میکنند که سیستمهای نظارتی متوجه آن نمیشوند؛ خطایی که منجر به انجام کارهای اشتباه (مثل لغو ناخواسته رزرو یا تغییرات غیرمجاز در حسابها) بدون نمایش هیچ هشداری میشود!
💡 پیشنهاد جذاب این مقاله، استفاده از «دروازههای بازرسی» (Deterministic Gates) قبل از اجرای دستورات است. این لایه امنیتی ساده، قبل از اینکه ابزار تغییرات را اعمال کند، درخواست را بررسی کرده و تا ۴۲٪ عملکرد موفق در سناریوهای آزمایشی را بهبود بخشیده است.
این تحقیق گام مهمی در جهت قابلاطمینانتر کردن هوش مصنوعی در محیطهای واقعی و تجاری محسوب میشود. 🤖✨
منبع: arXiv AI
