دانشمندان در مقاله جدیدی با معرفی بنچمارک «OrderBench»، به چالش بزرگی در استفاده از مدلهای زبانی (LLM) به عنوان «اجراکننده تراکنشها» اشاره کردهاند. 🤖
نکته کلیدی اینجاست: حتی اگر مدلهای هوش مصنوعی با استفاده از JSON Schema خروجیهایی با فرمت کاملاً صحیح تولید کنند، باز هم ممکن است از نظر منطقی و معنایی (Semantic) دچار خطا باشند و تراکنشهای ناامنی را پیشنهاد دهند. در واقع، ساختار درستِ داده، جایگزینی برای نظارت دقیق بر عملکرد هوش مصنوعی نیست!
این یک هشدار جدی برای مهندسان است که در پیادهسازی سرویسهای خود، صرفاً به خروجیهای ساختاریافته (Structured Output) اکتفا نکنند و لایههای اعتبارسنجی دامنه را حتماً در نظر بگیرند. 🛡️
منبع: arXiv AI
