编码 agent 正在作为受控执行接受测试
当前重点:编码 agent 按运行方式、修复能力和边界内行为来评判。A-ProS 展示了有状态评审反馈带来的提升。ProcBench 对轨迹中的过程缺陷打分。OverEager-Bench 衡量 benign 任务中的未授权动作。
当前重点:编码 agent 按运行方式、修复能力和边界内行为来评判。A-ProS 展示了有状态评审反馈带来的提升。ProcBench 对轨迹中的过程缺陷打分。OverEager-Bench 衡量 benign 任务中的未授权动作。
编码代理团队可以把运行时范围、轨迹质量和文件选择分开测试。证据支持在更广泛部署前先做几项实操检查:捕捉越界动作、给代理日志里的流程缺陷打分,以及在迭代修复前缩小修复上下文。
这一天最强的信号是带有可执行检查的实用代码代理工作。FrontierSmith 和 DIO-Agent 用评分或执行错误,把编码任务变得更难,也更有用。Orchard 在沙箱规模上展示了同样的需求。安全类论文把权限和第三方技能变成了核心设计问题。
代码代理工作正在收敛到团队现在就能构建和测试的运行控制:用于上线和资格判定的沙箱服务、针对 shell 访问和技能的按任务权限门控,以及带有可度量检索和文档质量的仓库上下文系统。共同的采用障碍是在真实工作流约束下完成验证。
当天最强的信号是面向智能体软件的可执行证据。论文用生成输入测试代码,用遥测诊断失败运行,并围绕技能或工具动作施加约束。现在,智能体输出要先有可检查的轨迹,团队才会信任它。
编码代理可靠性研究正在收敛到围绕生成代码、失败运行和可复用技能的几个小而可实现的检查。实际模式是在团队已经做出信任决策的地方收集执行证据:候选选择、重试指导或技能维护。
今天的编码研究最强的部分是对实际限制的说明。RealBench 显示 repo 级生成在完整项目上仍然会失效,token 成本研究显示 agentic coding 可能比聊天式帮助贵得多。最可信的改进来自更紧的结构:验证器反馈、自适应检索,以及围绕数据库访问的明确防护。
最清楚的短期变化都在执行层面。编码代理产品需要在运行中有明确的 token 控制,仓库规模生成在项目变大后需要按依赖顺序工作流,而维护团队可以为把需求链接到代码、并带上更小上下文和可见证据的追踪层找到理由。
这一天最强的论文把编码代理的主张做得更可执行,也更可检查。重点是对代理读什么、记什么、运行什么、以及允许改什么进行具体控制。EnvGraph 和 LiveCoder 把仓库生成和运行时验证、以及多次尝试证据绑定起来。DebugHarness 把修复推进到实时调试。Squeez 和 AmPermBench 收窄了两个运维瓶颈:上下文膨胀和权限覆盖。
执行证据正在进入编码代理工作流的中心。最清楚的产品变化有三类:保留仓库级尝试中有用状态的重试控制器、用于可复现 C 和 C++ 安全漏洞的调试器集成修复循环,以及以和 shell 命令同样严格程度检查文件编辑路径的权限控制。