محققان در مقالهای جدید به بررسی چالش جالبی در ایجنتهای رابط کاربری (GUI Agents) پرداختهاند. این ایجنتها معمولاً برای درک صفحه نمایش از دو منبع استفاده میکنند: «پیکسلهای تصویر» و «ساختار کد (DOM)».
نتایج این تحقیق نشان میدهد که اکثر مدلهای هوش مصنوعی در زمان تضاد بین این دو، به جای اعتماد به آنچه در تصویر میبینند (Visual Perception)، به ساختار کد (Structure) تکیه میکنند. حتی اگر مدل تصویر را درست ببیند، باز هم در تصمیمگیری نهایی اولویت را به دادههای متنی ساختار یافته میدهد که این میتواند در محیطهای واقعی منجر به خطا شود.
این یافته برای توسعهدهندگان ایجنتهای خودمختار که در حال کار روی تعامل هوش مصنوعی با نرمافزارها هستند، نکته بسیار کلیدی و مهمی است!
نویسی
منبع: arXiv AI
