想法

244 个想法 · 第 7 / 21 页
日 · 2026-06-16 · Software Intelligence

编码代理验证控制

代理编写的代码需要质量门禁来检查测试实际断言的内容,需要修复循环把有针对性的执行证据传回模型,也需要评估报告区分模型、harness、环境、验证器和技能的影响。共同的操作问题是虚假的信心:PR 可能包含断言很弱的测试,修复代理可能只能看到通过/失败反馈,而排行榜分数可能隐藏能让结果产生两位数百分点变化的 harness 选择。

日 · 2026-06-14 · Software Intelligence

Controlled Coding Agent Workspaces

代理采用正在撞上当前开发工具常被当作事后补救的控制点:凭据放在哪里、项目事实如何持久化、审查者如何拿到生成代码遵守本地不变量的证据。最实际的做法,是围绕无密钥工作区、带成本测量的项目级代理记忆,以及面向证明的审查检查,做几个小试点,先放在那些对正确性要求很高的代码库里。

日 · 2026-06-13 · Software Intelligence

受控的代理式工程工作流

工程团队可以通过在上下文、支出、验证和数据不变量上加明确控制,把代理式开发推进到更窄的生产工作流里。最直接的近期开关是有支出上限的 Claude Code 子代理链、带代理可读契约和代理自跑测试门禁的项目规范,以及在加锁前要求写明数据库不变量的 Rails 变更审查。

日 · 2026-06-11 · Software Intelligence

代理自主性检查点

编码代理团队现在有了几个可以加控制的具体位置:仓库说明的可执行检查、代理拉取请求进入审查前的拒绝门,以及用于 CAD 工作的沙箱化程序动作通道。共同压力来自审查浪费和不安全的自主性,尤其是在代理可以修改仓库、发起拉取请求或操作专业 Windows 软件的工作流里。

日 · 2026-06-10 · Embodied AI

Contact-Aware VLA Manipulation

评估 VLA 策略的机器人实验室,在扩大量采集前,应先测试三个具体补充:用于快速接触信号的传感器速率缓冲、在与真实系统对齐的模拟器中训练的触觉纠正,以及用于分布外操作的冻结 world-action 先验。常见的采用阻碍是物理交互:仅靠相机或单一时钟的策略会漏掉力峰值、隐藏接触状态,以及在位姿、几何形状或光照变化下的场景动力学。

日 · 2026-06-10 · Software Intelligence

Coding Agent Control Points

编码代理的采用正在转向具体控制点:用打分的 harness 运行来区分模型质量和 adapter 设计,用本地仓库记忆在重复失败修改前发出警告,以及为会压制拒绝的代码生成模式加入安全检查。真正有用的工作很具体:固定评估契约,把项目状态记录在聊天窗口之外,并在 decoder 设置进入开发流程之前先测试它们。