تحقیقات جدید در حوزهی GUI Agents (ایجنتهای رابط کاربری) نشان میدهد که این مدلها در درک محیط دچار یک چالش جالب هستند! وقتی این ایجنتها با دو منبع اطلاعاتی یعنی «پیکسلهای تصویر» و «ساختار متنی (DOM)» روبرو میشوند، در بسیاری از مواقع به جای اعتماد به آنچه میبینند، به ساختار متنی تکیه میکنند.
محققان با معرفی معیاری به نام «شکاف درک-تلفیق» (Perception-Fusion Gap) متوجه شدند که حتی اگر مدلها تصویر را درست تحلیل کنند، در صورت وجود تضاد، اولویت را به ساختار متنی میدهند که این موضوع گاهی منجر به خطاهای عملیاتی و شکست در انجام تسکها میشود. این یافته برای توسعهدهندگان ایجنتهای خودکار بسیار کلیدی است تا سیستمهای هوشمند دقیقتری طراحی کنند.
منبع: arXiv AI
