主题概况

Coding Agents

第 1 / 16 页
趋势
88
想法
102
最近一期
2026-07-23
想法 · 日 · 2026-07-19 · Software Intelligence

持久化、可使用工具的智能体工作流中的隐私控制

在模型调用前处理 PII,并不能覆盖智能体保留或处理敏感数据的所有位置。仓库记录、持久化记忆和已连接的应用需要分别检查;经过转换的身份信息则应仅在获得授权的操作执行时解析。所检查的产品都记录了这些数据面,但没有提供可比较的可靠性数据或端到端隐私测量结果。

想法 · 日 · 2026-07-17 · Software Intelligence

面向代理介导软件变更的有针对性证据

仓库政策可以将贡献风险转化为具体、可执行的证据:用于验证行为变更的差分测试、用于安全敏感型提示词的变异测试,以及用于导入机器学习训练代码的隐私探测。实际的共同变化是,依据贡献可能失败的路径选择验证方式,而不是接受通用测试或准确率结果。

趋势 · 日 · 2026-07-16 · Software Intelligence

可执行门控揭示静态代理评分遗漏的失败

近期围绕工程化检查的进展正变得更加面向实际操作。当前证据支持将控制措施绑定到实际源状态、工具版本和领域规则。静态或纯文本的成功表现可能掩盖供应链、工作流和适应性方面的失败。这些研究大多范围较窄或处于早期阶段,因此确立的是具体的失败模式,而不是广泛的生产可靠性。

趋势 · 日 · 2026-07-15 · Software Intelligence

工具编排选择会改变智能体得分、工具习惯和安全结果

近期关于工程化上下文和可执行检查的证据,正在工具编排框架层面变得更加具体。今天的研究表明,交互协议会改变基准得分,持久会话可能使智能体固守过时的工具使用流程,而有针对性的探索可以改善安全分析。部署仍不成熟:观察到的编码智能体使用并不普遍,而且通常由一个人监督。

想法 · 日 · 2026-07-15 · Software Intelligence

结合交互历史与可执行证据的智能体发布检查

智能体评估应保留那些会改变行为的交互条件;安全和拉取请求工作流则应将有后果的操作绑定到可检查的证据和范围狭窄的授权上。近期最有用的改进包括:测试工具适应能力的发布检查、由证据门控的安全发现,以及围绕当前编码智能体使用中常见的单维护者工作流设计的轻量级授权收据。

趋势 · 日 · 2026-07-14 · Software Intelligence

结构化上下文降低智能体成本,但更快的审查仍伴随质量风险

证据进一步支持近期的发现:编码智能体的收益取决于经过设计的上下文和可执行检查。新研究报告了更低的 token 使用量、更窄的搜索范围,以及更好的修复或规范生成结果。然而,一项大规模观察性审查研究将更快的智能体辅助决策与更多质量异味联系起来。大多数结果仍局限于特定基准或组织,因此它们支持对工作流的设计选择,而不是对已部署智能体作出广泛判断。