محققان در مطالعهای جدید به سراغ سنجش توانایی مدلهای هوش مصنوعی در درک «تغییرات رابط کاربری» رفتهاند. مشکل بسیاری از مدلهای فعلی این است که درک درستی از نحوه تغییر وضعیت صفحات در محیطهای نرمافزاری ندارند.
با معرفی بنچمارک جدید «EvoGUI»، حالا میتوانیم بفهمیم مدلهای بینایی-زبانی (VLM) چقدر در تشخیص توالی رویدادها، پیشبینی اقدامات و درک تغییرات صفحه نمایش هوشمند عمل میکنند. نتایج اولیه نشان میدهد که حتی قویترین مدلها هم هنوز راه زیادی برای رسیدن به درک کامل محیطهای کاربری دارند.
این تحقیق نشان میدهد که برای ساخت «عوامل هوشمند» (Agents) که بتوانند مثل یک انسان با اپلیکیشنها کار کنند، هنوز باید روی درک عمیقتر از تعاملات رابط کاربری کار کنیم. 💻🚀
منبع: arXiv AI
