محققان به تازگی بنچمارک جدیدی به نام «Desktop-Delta Bench» (DDB) معرفی کردهاند که یک چالش اساسی در مدلهای عاملِ کامپیوتری (Computer-Use Agents) را هدف قرار داده است.
تا امروز، بسیاری از مدلها در تشخیص «تغییرات واقعی» در محیط GUI (رابط کاربری گرافیکی) دچار مشکل بودند. به این معنی که نمیتوانستند تفاوت بین یک تغییر در اثرِ یک عملِ درست و یا یک وقفه/خطایِ تصادفی را تشخیص دهند.
این بنچمارک با بیش از ۲ هزار نمونه انسانی در محیط لینوکس، به ما کمک میکند تا بفهمیم مدلهای هوش مصنوعی تا چه حد در درک علت و معلولیِ فعالیتهای دسکتاپ دقیق هستند. نتایج اولیه نشان میدهد که مدلها هنوز راه زیادی برای رسیدن به دقت ۱۰۰ درصدی در این زمینه دارند! 🖥️✨
منبع: arXiv AI



