团队信任自主性之前,编码代理现在需要运行时证明
本周的编码代理研究把信任作为运营问题处理。较强的工作要求在接受更长时间的自主编码前,先提供当前状态、可执行检查、隐藏测试和可审查轨迹。
本周的编码代理研究把信任作为运营问题处理。较强的工作要求在接受更长时间的自主编码前,先提供当前状态、可执行检查、隐藏测试和可审查轨迹。
编码代理的采用正在转向具体的运行时控制:文件访问门禁、隐藏行为测试、变异检查,以及带终止状态的任务包。务实的起点是在授予更大自主权之前,通过执行轨迹和外部验证,让代理输出可供评审。
当前重点是:coding-agent 工作正在把进展绑定到可检查的证据上。P2T 组织修复步骤,SWE-Mutation 测试生成的测试能否抓住真实 bug,MOSS 在源代码更新前重放生产故障。
编码代理的采用现在需要保留结果背后证据的检查:生成测试要看突变体是否存活,拉取请求要看审查上下文和重构风险,已部署代理的源代码级更新要回放用户失败。
当天最强的信号是可执行证明。SpecBench 表明公共测试会奖励空壳系统,而 FuzzingBrain V2 和 ERA 用评估循环来验证崩溃或改进科学指标。当前门槛是隐藏测试、运行时检查或任务特定检查下的具体行为。
当验收依赖可执行的行为检查时,代理编写的代码就更可用。最清楚的流程变化是:为生成系统设置隐藏的端到端测试、用崩溃结果支撑安全分诊,以及为旧代码迁移设置行为判定器。
当前重点:编码 agent 按运行方式、修复能力和边界内行为来评判。A-ProS 展示了有状态评审反馈带来的提升。ProcBench 对轨迹中的过程缺陷打分。OverEager-Bench 衡量 benign 任务中的未授权动作。
编码代理团队可以把运行时范围、轨迹质量和文件选择分开测试。证据支持在更广泛部署前先做几项实操检查:捕捉越界动作、给代理日志里的流程缺陷打分,以及在迭代修复前缩小修复上下文。
代码代理工作现在已有足够证据支持更窄的采用门禁:接受代理拉取请求前要求可运行的设置和测试证明;信任排行榜数字前审计评测工具链中的分数利用;漏洞修复中使用成对的崩溃和安全执行。共同的运维需求是一份记录,说明运行了什么、什么失败了、改了什么,以及可用权限有哪些。
这一时期最清楚的信号是:代码代理正在按完整、可检查的工作来评分。SWE-Cycle 和 Phoenix-bench 把环境搭建、测试和领域工具链纳入评分。CRANE 表明,在保护工具调用格式时,模型编辑可以提高代理通过率。
完整的代理工作现在需要证据,证明代理完成了项目搭建、选对了文件、运行了有意义的检查,并保住了原有行为。可行的做法很具体:给代理 PR 加追踪包,给 HDL 代理输入可执行的 EDA 失败日志,并在要求代理写语义测试之前,按模型测试 property-based 提示。
当天最强的信号是智能体系统的可审计性。BenchJack 在智能体运行前就攻击基准 harness。Rollout Cards 要求评估发布回放证据。Cloudflare 的模型上下文协议(MCP)部署把同样的控制问题带进了企业工具访问。