🤖 آیا هوش مصنوعی واقعاً محیط دسکتاپ را درک می‌کند؟

🧠 چرا هوش مصنوعی گاهی «خیالات» می‌بیند؟

محققان به تازگی بنچمارک جدیدی به نام «Desktop-Delta Bench» (DDB) معرفی کرده‌اند که یک چالش اساسی در مدل‌های عاملِ کامپیوتری (Computer-Use Agents) را هدف قرار داده است.

تا امروز، بسیاری از مدل‌ها در تشخیص «تغییرات واقعی» در محیط GUI (رابط کاربری گرافیکی) دچار مشکل بودند. به این معنی که نمی‌توانستند تفاوت بین یک تغییر در اثرِ یک عملِ درست و یا یک وقفه/خطایِ تصادفی را تشخیص دهند.

این بنچمارک با بیش از ۲ هزار نمونه انسانی در محیط لینوکس، به ما کمک می‌کند تا بفهمیم مدل‌های هوش مصنوعی تا چه حد در درک علت و معلولیِ فعالیت‌های دسکتاپ دقیق هستند. نتایج اولیه نشان می‌دهد که مدل‌ها هنوز راه زیادی برای رسیدن به دقت ۱۰۰ درصدی در این زمینه دارند! 🖥️✨

منبع: arXiv AI