端到端软件交付基准
基准开始把编码当成完整工作周期来评测。SWE-Cycle 让智能体在 489 个 GitHub issue 实例中设置仓库、修改代码并编写验证测试。Phoenix-bench 加入硬件工程仓库和可执行 EDA 检查;智能体在这些任务上的迁移效果差,因为领域工具链和项目结构会影响结果。SaaSBench 和 WebGameBench 把同一标准推进到交付应用:企业 SaaS 系统和可玩的浏览器游戏按运行时行为、配置和跨组件集成来评判。
本周的代码智能体研究提高了有用工作的评测门槛。SWE-Cycle 和 SaaSBench 对设置、集成、测试和交付行为评分。Rollout Cards 为智能体运行增加报告规范。共同要求很直接:智能体需要拿出证据,证明任务是在真实运行约束下完成的。
基准开始把编码当成完整工作周期来评测。SWE-Cycle 让智能体在 489 个 GitHub issue 实例中设置仓库、修改代码并编写验证测试。Phoenix-bench 加入硬件工程仓库和可执行 EDA 检查;智能体在这些任务上的迁移效果差,因为领域工具链和项目结构会影响结果。SaaSBench 和 WebGameBench 把同一标准推进到交付应用:企业 SaaS 系统和可玩的浏览器游戏按运行时行为、配置和跨组件集成来评判。
多篇论文把执行结果用作监督来源或任务约束。DuST 使用测试时扩展过程中产生、并带有执行标签的候选代码来训练。FrontierSmith 把封闭式编码任务转成开放式优化问题,DIO-Agent 在代码发现过程中使用执行错误。Orchard 增加了可复用的沙箱基础设施,让智能体可以在软件工程、浏览器使用和助手场景中运行任务。实际方向一致:评分、错误和沙箱状态正在成为数据流水线的一部分。
本周的研究也把智能体分数当作需要检查的对象。BenchJack 在常规运行前审计基准中的奖励黑客路径,并在 10 个热门基准中发现了可利用点。Rollout Cards 要求智能体论文发布 rollout 记录、视图、报告规则和省略字段,以便重新检查分数。Model Context Protocol (MCP) 在企业工具中的部署提出了同样的控制问题:访问、权限和第三方技能需要审查路径,之后智能体才能在生产环境中执行操作。
安全修复工作集中在运行时证据和可复用修复知识上。ContraFix 比较崩溃执行和安全执行,以推断补丁必须强制满足的条件,然后存储成功的修复规格和输入变异策略。MemRepair 为仓库级漏洞修复增加持久记忆,并报告了在 SEC-Bench、PatchEval 和 Multi-SWE-bench C++ 上的提升。这些系统把过去的修复和具体执行作为下一次修复尝试的输入,使评估既依赖轨迹质量,也依赖补丁文本。