想法

244 个想法 · 第 12 / 21 页
日 · 2026-05-14 · Software Intelligence

代码代理验证控制

代码代理工作正在收敛到团队现在就能构建和测试的运行控制:用于上线和资格判定的沙箱服务、针对 shell 访问和技能的按任务权限门控,以及带有可度量检索和文档质量的仓库上下文系统。共同的采用障碍是在真实工作流约束下完成验证。

日 · 2026-05-13 · Software Intelligence

Agent verification records

完整的代理工作现在需要证据,证明代理完成了项目搭建、选对了文件、运行了有意义的检查,并保住了原有行为。可行的做法很具体:给代理 PR 加追踪包,给 HDL 代理输入可执行的 EDA 失败日志,并在要求代理写语义测试之前,按模型测试 property-based 提示。

日 · 2026-05-12 · Software Intelligence

可审计的代理运维

代理团队现在有了可以直接照搬的审计关卡:基准的发布前 reward-hacking 运行、带 trace 要求的集中治理 MCP 服务器,以及代码翻译的路径级审查。共同的压力是运维层面的:分数、工具调用和翻译后的代码都需要保留证据,供别的团队事后检查。

周 · 2026-W19 · Embodied AI

VLA 策略就绪准入检查

机器人 VLA 团队应把不利状态恢复试验、低带宽未来状态测试和发布后所有权检查,放入与名义任务成功率相同的准入检查中。实际变化是:收集失败和恢复 episode,测量紧凑状态在真实推理预算下是否有帮助,并在下游调优后验证已发布策略。

日 · 2026-05-10 · Embodied AI

Robot Policy Reliability

机器人团队可以用具体产物来测试可靠性工作:用于接触漂移的恢复标注 rollout、用于长时序 VLA 推理的熵门控搜索、把门店视频转成机器人动作流以适配零售场景,以及面向可变形物体的动作条件世界模型。

日 · 2026-05-10 · Software Intelligence

Agent Failure-Mode Gates

Agent 软件工作正在转向与具体失败模式绑定的检查:会返回看似合理却错误结果的实时工具调用、用狭窄攻击集测试的监控器,以及顺序测试漏掉共享内存交互的 C/C++ 库。实际工作是在这些流程前面加小门槛,避免 agent 直接接触生产系统或安全关键仓库。