arXiv:2605.19769cs.AIcs.SE2026-05被引 8

构建可验证的软件世界,让电脑代理任务完成更可信。

OpenComputer: Verifiable Software Worlds for Computer-Use Agents

论文配图:OpenComputer: Verifiable Software Worlds for Computer-Use Agents
图 1 · 摘自论文原文
  • 用结构化检查点实时验证应用状态,确保任务执行可审计。
  • 覆盖33个桌面应用和1000个可机器验证的任务,支持浏览器到开发环境全场景。
  • 适合研究自动化代理鲁棒性,尤其关注细粒度状态判断的场景。

我们提出OpenComputer,一个基于验证器的框架,用于构建可验证的计算机使用代理软件世界。该框架包含四个组件:(1) 针对特定应用的状态验证器,通过真实应用暴露结构化检查接口;(2) 自我演进的验证层,利用执行反馈提升验证器可靠性;(3) 任务生成流水线,合成真实且可机器验证的桌面任务;(4) 评估工具包,记录完整轨迹并计算可审计的部分奖励。当前版本涵盖33个桌面应用和1000个已确定任务,覆盖浏览器、办公工具、创作软件、开发环境、文件管理器及通信应用。实验表明,OpenComputer的硬编码验证器与人工裁定一致性更高,尤其在依赖精细应用状态时表现更优。前沿代理虽有部分进展,但难以端到端完成任务,开源模型在从OSWorld-Verified得分中显著下降,揭示了计算机自动化在鲁棒性上的持续差距。

原文摘要 · Abstract (English)

We present OpenComputer, a verifier-grounded framework for constructing verifiable software worlds for computer-use agents. OpenComputer integrates four components: (1) app-specific state verifiers that expose structured inspection endpoints over real applications, (2) a self-evolving verification layer that improves verifier reliability using execution-grounded feedback, (3) a task-generation pipeline that synthesizes realistic and machine-checkable desktop tasks, and (4) an evaluation harness that records full trajectories and computes auditable partial-credit rewards. In its current form, OpenComputer covers 33 desktop applications and 1,000 finalized tasks spanning browsers, office tools, creative software, development environments, file managers, and communication applications. Experiments show that OpenComputer's hard-coded verifiers align more closely with human adjudication than LLM-as-judge evaluation, especially when success depends on fine-grained application state. Frontier agents struggle with end-to-end completion despite partial progress, and open-source models exhibit sharp drops from their OSWorld-Verified scores, exposing a persistent gap in robust computer automation.

智能代理自动化评估可验证系统桌面任务

Thank you to arXiv for use of its open access interoperability. PaperDance 不是 arXiv 官方产品;中文卡片由大模型生成,请以原文为准。