来源笔记
How Agent Skills Fail under Long Contexts: A White-Box Study in Code Auditing
Code IntelligenceSoftware Foundation ModelsAutomated Software ProductionMulti Agent Software EngineeringHuman AI Interaction
摘要
这项白盒研究发现,在固定的代码审计任务上,长上下文可能显著降低编码代理的可靠性,但影响取决于任务和具体运行。与通用的自检指令相比,明确的检查清单能更稳定地提高完成率;同时,基础设施故障也构成了独立的缺失数据来源。
问题
- Agent Skills 包含程序性要求,但编码代理在长时间使用工具的轨迹中,可能遗漏或停止执行某些单独的要求。
- 这很重要,因为即使审计产物几乎完整,只要遗漏一个必填字段、保留规则或验证条件,仍可能导致任务失败。
- 仅看最终通过率,无法判断失败源于要求丢失、编辑偏移、检查失败,还是评估器或运行时基础设施问题。
方法
- 作者研究了一个源自生产环境的白盒代码审计工作流,其中任务、初始产物、工具以及包含 24 项可观察检查的冻结验证器均保持不变,覆盖四项审计任务。
- 他们比较了 Codex with gpt-5.4-mini 在 10,991 字符干净上下文中的表现,以及在 299,140 字符的相关和无关上下文中的表现;每种条件均使用 10 次有效运行。
- 保存的指令、产物、工具日志和检查器输出支持一个四类失败分类法:要求丢失、编辑偏移、检查失败,以及非代理失败。
- 缓解实验比较了两种指令:一种是验证所有约束的通用指令,另一种是明确重述全部 24 项检查的详细清单。
- 探索性探针测试了其他模型、任务和编码代理脚手架,但这些比较并未完全匹配,也没有足够的统计推断能力。
结果
- 在主要任务上,干净上下文通过 8/10 次运行,而相关长上下文和无关长上下文均通过 3/10 次。观察到的失败率从 20% 上升到 70%,增加了 50 个百分点,即达到原来的 3.5 倍。
- 主要对比结果仍存在不确定性:双侧 Fisher 精确检验的 p=0.0698,既未低于预先设定的 alpha=0.05 阈值,也不足以支持“长上下文普遍产生影响”的确定性结论。
- 尽管任务成功率较低,要求覆盖率仍然很高:干净上下文运行通过 237/240 项检查(98.8%),相关长上下文运行通过 221/240 项(92.1%),无关长上下文运行通过 225/240 项(93.8%)。
- 相关和无关长上下文的二元结果完全相同,均为 3/10 次通过,Fisher p=1.0;研究没有发现可靠证据表明,在字符长度相同的情况下,同领域材料比无关材料更有害。
- 详细的外部检查清单通过 10/10 次运行,而通用自检通过 5/10 次,Fisher p=0.0325。
- 第二项任务在干净上下文和长上下文运行中全部通过,因此证据支持的是某一模型—任务组合的高方差可靠性下降,而不是普遍存在的上下文长度阈值。在扩展实验中,57 次尝试只有 29 次产生可评分输出,这将基础设施可靠性与代理—任务成功区分开来。