JarvisGUI:迈向跨设备图形用户界面智能体的动态任务组合
arXiv cs.AI · · 发布于 2026-09-11 · 3 分钟阅读
现实中的图形用户界面使用常涉及跨多设备、多平台的工作流,需要传递中间结果、维护共享状态并协调异构环境。但现有基准多在单设备、静态定义的任务上评估智能体,跨设备能力几乎未被考察,导致对其真实场景就绪程度的高估。作者提出 JarvisGUI,一个动态基准,在涵盖 Android、Windows 和 Ubuntu 等异构平台的跨设备工作流上评估图形用户界面智能体。JarvisGUI 将任务形式化为轻量类型系统下的输入与输出变换,可自动组合多步跨设备工作流,并在统一框架内动态评估智能体表现。在跨多种操作系统的虚拟环境中进行评估后,JarvisGUI 显示最先进的开源图形用户界面智能体在状态传递意识、跨平台上下文推理与长程依赖管理方面存在困难,暴露出既有基准无法发现的关键能力缺口。
当前来源仅提供摘要,以下要点基于摘要生成;可通过官方原文查看完整信息。背景需求
现实图形用户界面工作流经常跨多个设备和平台,需要传递中间结果、维护共享状态并协调异构环境。
现有局限
现有图形用户界面基准绝大多数只评估单设备、静态定义任务,跨设备能力未被充分检验。
提出基准
作者提出 JarvisGUI,一个用于跨设备工作流的动态基准。
方法形式化
JarvisGUI 将图形用户界面任务形式化为轻量类型系统下的输入输出变换。
自动组合与动态评估
该设计允许自动组合多步、跨设备工作流,并在统一框架内动态评估智能体表现。
评测环境
评测在涵盖 Android、Windows 和 Ubuntu 的多个操作系统虚拟环境中进行。
主要发现
最先进的开源图形用户界面智能体在状态转移意识、跨平台上下文推理和长时程依赖管理上存在困难。
研究意义
该基准暴露了既有基准无法看见的关键能力缺口,提示对智能体真实可用性的评估可能过于乐观。
SOURCES
共 1 个来源来源与引用
官方原文arXiv cs.AI 原始发布2026-09-11 · 一手信息https://arxiv.org/abs/2609.10451