想法

244 个想法 · 第 6 / 21 页
周 · 2026-W25 · Software Intelligence

代码智能体验收控制

代码智能体采用正在转向具体的验收检查:经过失败测试的仓库指令、围绕智能体工作的轨迹门禁,以及面向陌生语料的分配前考试。有用工作位于模型周围的支持层:智能体被告知了什么、它实际做了什么、它使用了哪些证据,以及在人类评审结果前通过了哪些检查。

日 · 2026-06-20 · Software Intelligence

内部智能体的运行控制

智能体采用正在转向模型周边的运行控制:任务租约、证据包、带来源的记忆、API 调用检查和带身份信息的日志。实际工作是在现有开发者和内部工具工作流中加入这些控制,使失败可见且测试成本较低。

日 · 2026-06-19 · Software Intelligence

受控智能体运营

智能体团队现在有了可测试的具体控制模式:用于过期状态故障的确定性重放、用于多文件安全缺陷的发布前源码审计,以及用于常规知识工作的会话锁定模型路由。公开证据大多来自产品或文章主张,因此更有用的做法是开展范围较窄的本地试验,并衡量误报、成本、延迟和回滚行为。

日 · 2026-06-18 · Embodied AI

操作 rollout 准备度

机器人实验室可以通过三项改动提高部署准备度:在 rollout 执行框架中加入故障报警,在下游微调前剪枝 VLA 层,并用 3D 一致的增强 episode 修复特定物体失败。每项改动都能接入现有操作工作流,并有可测量的首次测试:报警提前量、延迟和训练小时数降低,或失败物体上的成功率恢复。

日 · 2026-06-18 · Software Intelligence

编码代理发布控制

仓库维护者现在可以把代理指令、拉取请求创建和模型选择当作可测试的软件工作来处理。实际做法包括:在失败探针后修订的紧凑仓库指导、由基线对照测试和权限门禁阻断的 issue 代理拉取请求,以及覆盖生产所用语言和项目规模的评估套件。

日 · 2026-06-17 · Software Intelligence

关注来源的编码代理评估

编码代理工作正在转向几类检查:保留任务来源、区分可见正确性与隐藏安全行为,并把代理推理转化为可执行证据。这些实际改动足够小,可以放进现有评估和安全工作流中测试:让同一个模型通过多个运行框架执行,要求安全专用隐藏测试,要求审计代理写出可证伪断言,并基于截止日期前可用的仓库证据构建面向未来的任务。