🤖 آیا ایجنت‌های هوش مصنوعی واقعاً «می‌بینند»؟

⚠️ هشدار به محققان: چرا دقت مدل‌های شناسایی پهپاد گاهی «واقعی» نیست؟

تحقیقات جدید در حوزه‌ی GUI Agents (ایجنت‌های رابط کاربری) نشان می‌دهد که این مدل‌ها در درک محیط دچار یک چالش جالب هستند! وقتی این ایجنت‌ها با دو منبع اطلاعاتی یعنی «پیکسل‌های تصویر» و «ساختار متنی (DOM)» روبرو می‌شوند، در بسیاری از مواقع به جای اعتماد به آنچه می‌بینند، به ساختار متنی تکیه می‌کنند.

محققان با معرفی معیاری به نام «شکاف درک-تلفیق» (Perception-Fusion Gap) متوجه شدند که حتی اگر مدل‌ها تصویر را درست تحلیل کنند، در صورت وجود تضاد، اولویت را به ساختار متنی می‌دهند که این موضوع گاهی منجر به خطاهای عملیاتی و شکست در انجام تسک‌ها می‌شود. این یافته برای توسعه‌دهندگان ایجنت‌های خودکار بسیار کلیدی است تا سیستم‌های هوشمند دقیق‌تری طراحی کنند.

منبع: arXiv AI