主题概况

Benchmarks

第 3 / 3 页
趋势
14
想法
14
最近一期
2026-06-09
趋势 · 日 · 2026-04-03 · Software Intelligence

编码代理研究正变得更难作弊,也更容易验证

这一阶段最强的内容集中在那些要面对真实状态、真实失败模式和真实执行后果的编码代理上。SWE-STEPS 和 ABTest 让评估更具体。GrandCode 给出一个醒目的现场结果,而 IndustryCode 用更难的工业任务把上限拉回到现实。当前重点更少放在一次性补丁是否成功,更集中在代理能否在时间、工具和仓库历史中保持稳定。

想法 · 日 · 2026-04-03 · Software Intelligence

仓库代理安全门

代码代理评估正在转向真实仓库状态、真实用户失败轨迹和真实扩展安全检查。眼下最明确的近期开销变化,是基于支持失败构建内部回放套件、带仓库健康评分的有状态 pull request 序列基准,以及在第三方技能接触开发者机器或 CI 之前设置隔离步骤。

趋势 · 日 · 2026-04-02 · Software Intelligence

软件代理研究正变得更可执行、可回放,也更贴近生产

今天的研究最强的地方,是软件工作可以通过执行来检查。重点是更严格地评估编码代理,以及为代码和 API 生成更好的测试。ProdCodeBench 和 ToolMisuseBench 都缩小了基准分数与部署条件之间的差距。结果是,我们更清楚地看到代理在哪些地方还能用,在哪些地方仍然会失效。

想法 · 日 · 2026-04-02 · Software Intelligence

Operational Agent Validation

面向生产的软件代理工作,正在三个地方变得更具体:用于编码代理的私有回放基准、用于工具调用失败与恢复的确定性测试,以及生成可运行脚本的、由需求驱动的 API 测试生成。每一项都能落到团队自己的仓库、工具契约或基于 OpenAPI 的服务上做试点。