主题概况

Software Testing

第 1 / 2 页
趋势
8
想法
11
最近一期
2026-07-21
想法 · 日 · 2026-07-17 · Software Intelligence

面向代理介导软件变更的有针对性证据

仓库政策可以将贡献风险转化为具体、可执行的证据:用于验证行为变更的差分测试、用于安全敏感型提示词的变异测试,以及用于导入机器学习训练代码的隐私探测。实际的共同变化是,依据贡献可能失败的路径选择验证方式,而不是接受通用测试或准确率结果。

趋势 · 日 · 2026-07-10 · Software Intelligence

当规范变得可执行且可复用时,编码代理的表现会提升

当天最有价值的工作将大语言模型(LLM)编码作为受控的工程流程。ReProAgent和TestAgent把仓库上下文与运行时反馈连接起来,DualVeri则将机器检查的证明与针对实际实现的测试结合起来。可复用的任务上下文也成为降低成本、提高完成率的实际手段。

想法 · 日 · 2026-07-10 · Software Intelligence

编码代理可靠性系统

编码代理团队可以通过将问题接收转换为失败后通过的测试、将反复出现的正确性断言编码为共享证明和基于属性的测试模板,以及在重复任务之间保留获批准的仓库上下文来提高可靠性。每项改动都可以先在少量真实维护任务上测试,再扩大采用范围。

想法 · 日 · 2026-05-10 · Software Intelligence

Agent Failure-Mode Gates

Agent 软件工作正在转向与具体失败模式绑定的检查:会返回看似合理却错误结果的实时工具调用、用狭窄攻击集测试的监控器,以及顺序测试漏掉共享内存交互的 C/C++ 库。实际工作是在这些流程前面加小门槛,避免 agent 直接接触生产系统或安全关键仓库。

趋势 · 日 · 2026-04-28 · Software Intelligence

编码代理的进展来自模型周边的接口

这一时期的基线仍然是可执行评测。最强的主张来自模型外部的部分:SWE-Edit 的读写分离、Agentic Harness Engineering 的 rollout 驱动 harness 编辑,以及 SAFEdit 的测试支撑修复循环。这个方向把上下文、工具、存储、安全提醒和推理成本都当作代理性能中可测量的部分。