主题概况

Software Engineering Benchmarks

第 1 / 2 页
趋势
5
想法
8
最近一期
2026-06-17
想法 · 日 · 2026-06-17 · Software Intelligence

关注来源的编码代理评估

编码代理工作正在转向几类检查:保留任务来源、区分可见正确性与隐藏安全行为,并把代理推理转化为可执行证据。这些实际改动足够小,可以放进现有评估和安全工作流中测试:让同一个模型通过多个运行框架执行,要求安全专用隐藏测试,要求审计代理写出可证伪断言,并基于截止日期前可用的仓库证据构建面向未来的任务。

想法 · 日 · 2026-06-10 · Software Intelligence

Coding Agent Control Points

编码代理的采用正在转向具体控制点:用打分的 harness 运行来区分模型质量和 adapter 设计,用本地仓库记忆在重复失败修改前发出警告,以及为会压制拒绝的代码生成模式加入安全检查。真正有用的工作很具体:固定评估契约,把项目状态记录在聊天窗口之外,并在 decoder 设置进入开发流程之前先测试它们。

想法 · 周 · 2026-W20 · Software Intelligence

代码代理运行溯源

代码代理工作现在已有足够证据支持更窄的采用门禁:接受代理拉取请求前要求可运行的设置和测试证明;信任排行榜数字前审计评测工具链中的分数利用;漏洞修复中使用成对的崩溃和安全执行。共同的运维需求是一份记录,说明运行了什么、什么失败了、改了什么,以及可用权限有哪些。

想法 · 日 · 2026-05-17 · Software Intelligence

编码代理的运行时验证循环

测试编码代理的团队应该增加验收门,运行交付出来的系统,在修复过程中保留运行时证据,并用已经执行过的 API 调用来训练工具调用器。真正有用的工作在代理周围的验证循环里:浏览器、Docker 运行时、测试、崩溃输入、安全输入和缓存的工具输出都会成为工作产物。