---
source: arxiv
url: https://arxiv.org/abs/2607.17937v1
published_at: '2026-07-20T13:34:53'
authors:
- Yue Xue
topics:
- code-intelligence
- software-foundation-models
- automated-software-production
- multi-agent-software-engineering
- human-ai-interaction
relevance_score: 0.92
run_id: materialize-outputs
language_code: zh-CN
---

# How Agent Skills Fail under Long Contexts: A White-Box Study in Code Auditing

## Summary
## 总结
这项白盒研究发现，在固定的代码审计任务上，长上下文可能显著降低编码代理的可靠性，但影响取决于任务和具体运行。与通用的自检指令相比，明确的检查清单能更稳定地提高完成率；同时，基础设施故障也构成了独立的缺失数据来源。

## 问题
- Agent Skills 包含程序性要求，但编码代理在长时间使用工具的轨迹中，可能遗漏或停止执行某些单独的要求。
- 这很重要，因为即使审计产物几乎完整，只要遗漏一个必填字段、保留规则或验证条件，仍可能导致任务失败。
- 仅看最终通过率，无法判断失败源于要求丢失、编辑偏移、检查失败，还是评估器或运行时基础设施问题。

## 方法
- 作者研究了一个源自生产环境的白盒代码审计工作流，其中任务、初始产物、工具以及包含 24 项可观察检查的冻结验证器均保持不变，覆盖四项审计任务。
- 他们比较了 Codex with gpt-5.4-mini 在 10,991 字符干净上下文中的表现，以及在 299,140 字符的相关和无关上下文中的表现；每种条件均使用 10 次有效运行。
- 保存的指令、产物、工具日志和检查器输出支持一个四类失败分类法：要求丢失、编辑偏移、检查失败，以及非代理失败。
- 缓解实验比较了两种指令：一种是验证所有约束的通用指令，另一种是明确重述全部 24 项检查的详细清单。
- 探索性探针测试了其他模型、任务和编码代理脚手架，但这些比较并未完全匹配，也没有足够的统计推断能力。

## 结果
- 在主要任务上，干净上下文通过 8/10 次运行，而相关长上下文和无关长上下文均通过 3/10 次。观察到的失败率从 20% 上升到 70%，增加了 50 个百分点，即达到原来的 3.5 倍。
- 主要对比结果仍存在不确定性：双侧 Fisher 精确检验的 p=0.0698，既未低于预先设定的 alpha=0.05 阈值，也不足以支持“长上下文普遍产生影响”的确定性结论。
- 尽管任务成功率较低，要求覆盖率仍然很高：干净上下文运行通过 237/240 项检查（98.8%），相关长上下文运行通过 221/240 项（92.1%），无关长上下文运行通过 225/240 项（93.8%）。
- 相关和无关长上下文的二元结果完全相同，均为 3/10 次通过，Fisher p=1.0；研究没有发现可靠证据表明，在字符长度相同的情况下，同领域材料比无关材料更有害。
- 详细的外部检查清单通过 10/10 次运行，而通用自检通过 5/10 次，Fisher p=0.0325。
- 第二项任务在干净上下文和长上下文运行中全部通过，因此证据支持的是某一模型—任务组合的高方差可靠性下降，而不是普遍存在的上下文长度阈值。在扩展实验中，57 次尝试只有 29 次产生可评分输出，这将基础设施可靠性与代理—任务成功区分开来。

## Problem

## Approach

## Results

## Link
- [https://arxiv.org/abs/2607.17937v1](https://arxiv.org/abs/2607.17937v1)
