编码代理验证控制
代理编写的代码需要质量门禁来检查测试实际断言的内容,需要修复循环把有针对性的执行证据传回模型,也需要评估报告区分模型、harness、环境、验证器和技能的影响。共同的操作问题是虚假的信心:PR 可能包含断言很弱的测试,修复代理可能只能看到通过/失败反馈,而排行榜分数可能隐藏能让结果产生两位数百分点变化的 harness 选择。
代理编写的代码需要质量门禁来检查测试实际断言的内容,需要修复循环把有针对性的执行证据传回模型,也需要评估报告区分模型、harness、环境、验证器和技能的影响。共同的操作问题是虚假的信心:PR 可能包含断言很弱的测试,修复代理可能只能看到通过/失败反馈,而排行榜分数可能隐藏能让结果产生两位数百分点变化的 harness 选择。
编码代理的采用正在转向可由软件检查的运行记录,然后再由人工签字确认。实际工作包括:要求可重放 QA 证据的 pre-push 门禁、只接受经验证器检查不变式的本地证明循环,以及让提示和工具调用避开明文主机内存的路由路径。
机器人 VLA 团队可以采取三项近期改动:在比较策略前标准化物理 rollout,为接触密集型控制分离传感器更新频率,并用交互证据给示教标签打分。每项改动都针对一个当前汇总成功率可能掩盖的失效模式。
编码代理采用现在需要围绕运行时循环做具体工作:在完成前强制执行重复的用户纠正,在同一评分契约下比较代理 harness,并在代理编辑文件前为其提供既往修复和失败尝试的本地记录。
代理采用正在撞上当前开发工具常被当作事后补救的控制点:凭据放在哪里、项目事实如何持久化、审查者如何拿到生成代码遵守本地不变量的证据。最实际的做法,是围绕无密钥工作区、带成本测量的项目级代理记忆,以及面向证明的审查检查,做几个小试点,先放在那些对正确性要求很高的代码库里。
工程团队可以通过在上下文、支出、验证和数据不变量上加明确控制,把代理式开发推进到更窄的生产工作流里。最直接的近期开关是有支出上限的 Claude Code 子代理链、带代理可读契约和代理自跑测试门禁的项目规范,以及在加锁前要求写明数据库不变量的 Rails 变更审查。
编码代理工作正朝着更小的规则表面、更窄的操作集合和定时的人类审查移动。真正有用的变化是代理配置迁移工具、安全本地编码的受限命令面,以及在长时间 AI 会话中强制做范围审查的检查点提示。
机器人操作团队可以根据现有证据做三项具体改动:按物理交互信号给示范标签打分,在部署自回归 VLA 策略前加入固定延迟解码测试,并在标准化接触硬件前按传感器类型测试触觉策略。
编码代理团队现在有了几个可以加控制的具体位置:仓库说明的可执行检查、代理拉取请求进入审查前的拒绝门,以及用于 CAD 工作的沙箱化程序动作通道。共同压力来自审查浪费和不安全的自主性,尤其是在代理可以修改仓库、发起拉取请求或操作专业 Windows 软件的工作流里。
评估 VLA 策略的机器人实验室,在扩大量采集前,应先测试三个具体补充:用于快速接触信号的传感器速率缓冲、在与真实系统对齐的模拟器中训练的触觉纠正,以及用于分布外操作的冻结 world-action 先验。常见的采用阻碍是物理交互:仅靠相机或单一时钟的策略会漏掉力峰值、隐藏接触状态,以及在位姿、几何形状或光照变化下的场景动力学。
编码代理的采用正在转向具体控制点:用打分的 harness 运行来区分模型质量和 adapter 设计,用本地仓库记忆在重复失败修改前发出警告,以及为会压制拒绝的代码生成模式加入安全检查。真正有用的工作很具体:固定评估契约,把项目状态记录在聊天窗口之外,并在 decoder 设置进入开发流程之前先测试它们。
这段时间的机器人操作工作指向三项实际改动:用固定的实体回放流程评测腕部视角策略,在执行前加入 RGB-D 动作检查,以及通过共享手部关键点和接触标签,利用人类视频训练灵巧手策略。