arXiv:2607.14275cs.AIcs.MA2026-07被引 1

上下文质量决定AI代理可靠性,而非模型本身。

AI Agents Do Not Fail Alone:The Context Fails First

论文配图:AI Agents Do Not Fail Alone:The Context Fails First
图 1 · 摘自论文原文
  • 通过七项指标量化上下文质量,独立评估代理行为风险。
  • 上下文质量能提前预测幻觉、工具误用等行为问题。
  • 适合关注AI安全与治理的研究者和开发者。

上下文工程已成为构建可靠AI代理的核心,却长期缺乏有效度量。代理的失败并非孤立发生,而是由其上下文中积累的指令、工具、记忆、检索知识、防护机制及不可信输入共同塑造。当上下文薄弱时,代理会漂移、产生幻觉、误用工具、忽略约束、易受注入攻击并浪费令牌。本文验证了上下文工程质量作为代理可靠性独立领先指标的有效性。我们基于ProofAgent-Harness开源评估框架,采用多评审员共识评分机制,从七个维度评估上下文:角色清晰度、防护覆盖度、指令一致性、工具模式质量、事实依据充分性、注入防护强度和令牌效率。关键在于,上下文评分与行为指标及发布决策完全分离,实现非循环验证。在受监管代理领域中控制前沿大模型不变,仅改变其运行上下文,实验表明上下文质量指标可稳定预测对应的行为结果:事实依据充分性预测抗幻觉能力,防护覆盖度预测抗操纵能力,指令一致性预测指令遵循度,工具模式质量预测工具使用效果。这些发现确立上下文度量为代理可靠性的验证前哨信号,并将上下文工程定位为可审计的代理评估与治理层级。

原文摘要 · Abstract (English)

Context engineering has become central to building reliable AI agents, yet it remains largely unmeasured. Agents do not fail in isolation: their behavior is shaped by the instructions, tools, memory, retrieved knowledge, guardrails, and untrusted inputs accumulated in their context. When this context is weak, agents drift, hallucinate, misuse tools, ignore constraints, become vulnerable to injection, and waste tokens. This paper validates context-engineering quality as an independent leading indicator of agent reliability. We implement the measurement in ProofAgent-Harness, an open-source infrastructure for AI agent evaluation that uses multi-juror, consensus-based scoring. The harness assesses context across seven criteria: role clarity, guardrail coverage, instruction consistency, tool schema quality, grounding sufficiency, injection hardening, and token efficiency. Crucially, the context score is isolated from behavioral metrics and release decisions, enabling a non-circular validation. Through a controlled context-quality study across regulated agent domains, holding frontier LLM agents fixed and varying only their operating context, we show that context-quality criteria consistently predict their corresponding behavioral outcomes. Grounding sufficiency predicts hallucination resistance, guardrail coverage predicts manipulation resistance, instruction consistency predicts instruction following, and tool-schema quality predicts tool use. These findings establish context measurement as a validated preflight signal for agent reliability and position context engineering as an auditable layer of agent evaluation and governance.

AI代理上下文工程可靠性评估安全治理

Thank you to arXiv for use of its open access interoperability. PaperDance 不是 arXiv 官方产品;中文卡片由大模型生成,请以原文为准。