NewsFi.AI
返回今日
已核验来源

JarvisGUI:迈向跨设备图形用户界面智能体的动态任务组合

arXiv cs.AI · · 发布于 2026-09-11 · 3 分钟阅读

NewsFi 导读3 分钟速览

现实中的图形用户界面使用常涉及跨多设备、多平台的工作流,需要传递中间结果、维护共享状态并协调异构环境。但现有基准多在单设备、静态定义的任务上评估智能体,跨设备能力几乎未被考察,导致对其真实场景就绪程度的高估。作者提出 JarvisGUI,一个动态基准,在涵盖 Android、Windows 和 Ubuntu 等异构平台的跨设备工作流上评估图形用户界面智能体。JarvisGUI 将任务形式化为轻量类型系统下的输入与输出变换,可自动组合多步跨设备工作流,并在统一框架内动态评估智能体表现。在跨多种操作系统的虚拟环境中进行评估后,JarvisGUI 显示最先进的开源图形用户界面智能体在状态传递意识、跨平台上下文推理与长程依赖管理方面存在困难,暴露出既有基准无法发现的关键能力缺口。

当前来源仅提供摘要,以下要点基于摘要生成;可通过官方原文查看完整信息。
1

背景需求

现实图形用户界面工作流经常跨多个设备和平台,需要传递中间结果、维护共享状态并协调异构环境。

2

现有局限

现有图形用户界面基准绝大多数只评估单设备、静态定义任务,跨设备能力未被充分检验。

3

提出基准

作者提出 JarvisGUI,一个用于跨设备工作流的动态基准。

4

方法形式化

JarvisGUI 将图形用户界面任务形式化为轻量类型系统下的输入输出变换。

5

自动组合与动态评估

该设计允许自动组合多步、跨设备工作流,并在统一框架内动态评估智能体表现。

6

评测环境

评测在涵盖 Android、Windows 和 Ubuntu 的多个操作系统虚拟环境中进行。

7

主要发现

最先进的开源图形用户界面智能体在状态转移意识、跨平台上下文推理和长时程依赖管理上存在困难。

8

研究意义

该基准暴露了既有基准无法看见的关键能力缺口,提示对智能体真实可用性的评估可能过于乐观。

SOURCES

来源与引用

共 1 个来源
官方原文arXiv cs.AI 原始发布2026-09-11 · 一手信息
https://arxiv.org/abs/2609.10451