主题概况

Coding Agents

第 16 / 16 页
趋势
88
想法
102
最近一期
2026-07-23
想法 · 周 · 2026-W14 · Software Intelligence

可执行的 agent 工作流基准

本周指向了 coding agent 工作流中的三个实际改动:用真实生产会话搭建离线回放基准,在 agent 循环中加入工具输出裁剪以减少重复上下文加载,以及按相互依赖的 PR 序列来评估 agent,而不是一次只看一个任务。这三个方向都依赖可执行的检查方式,例如稳定测试、保留的仓库状态,以及可测量的 token 或延迟变化。

趋势 · 日 · 2026-04-05 · Software Intelligence

Software-agent evidence is getting tighter around control loops, compilers, and architecture checks

这一天的研究最强的部分,是那些可以用明确控制来检查的软件代理。证据最扎实的工作把模型接到编译器、工单状态、校验器门控或经过基准测试的设计工件上。这让我们更清楚地看到代理现在能做什么,以及可靠性还会在哪些地方失效,尤其是在架构理解上。

想法 · 日 · 2026-04-05 · Software Intelligence

软件代理控制门

软件代理工作里的控制面现在变得更具体了,尤其是在工单、编译器和评审门给系统划出硬边界的地方。最清楚的近期落地方案是:用于有边界维护工作的 Jira 关联执行循环、利用编译器反馈提升编译成功率的 GnuCOBOL 修复服务,以及在提示词驱动的系统变更被当成普通代码修改通过之前将其拦下的架构评审门。

趋势 · 日 · 2026-04-04 · Software Intelligence

编码代理研究正在按执行循环、运行时证据和真实动作控制来评判

这一天最强的论文把编码代理的主张做得更可执行,也更可检查。重点是对代理读什么、记什么、运行什么、以及允许改什么进行具体控制。EnvGraph 和 LiveCoder 把仓库生成和运行时验证、以及多次尝试证据绑定起来。DebugHarness 把修复推进到实时调试。Squeez 和 AmPermBench 收窄了两个运维瓶颈:上下文膨胀和权限覆盖。

趋势 · 日 · 2026-04-03 · Software Intelligence

编码代理研究正变得更难作弊,也更容易验证

这一阶段最强的内容集中在那些要面对真实状态、真实失败模式和真实执行后果的编码代理上。SWE-STEPS 和 ABTest 让评估更具体。GrandCode 给出一个醒目的现场结果,而 IndustryCode 用更难的工业任务把上限拉回到现实。当前重点更少放在一次性补丁是否成功,更集中在代理能否在时间、工具和仓库历史中保持稳定。

想法 · 日 · 2026-04-03 · Software Intelligence

仓库代理安全门

代码代理评估正在转向真实仓库状态、真实用户失败轨迹和真实扩展安全检查。眼下最明确的近期开销变化,是基于支持失败构建内部回放套件、带仓库健康评分的有状态 pull request 序列基准,以及在第三方技能接触开发者机器或 CI 之前设置隔离步骤。

趋势 · 日 · 2026-04-02 · Software Intelligence

软件代理研究正变得更可执行、可回放,也更贴近生产

今天的研究最强的地方,是软件工作可以通过执行来检查。重点是更严格地评估编码代理,以及为代码和 API 生成更好的测试。ProdCodeBench 和 ToolMisuseBench 都缩小了基准分数与部署条件之间的差距。结果是,我们更清楚地看到代理在哪些地方还能用,在哪些地方仍然会失效。

想法 · 日 · 2026-04-02 · Software Intelligence

Operational Agent Validation

面向生产的软件代理工作,正在三个地方变得更具体:用于编码代理的私有回放基准、用于工具调用失败与恢复的确定性测试,以及生成可运行脚本的、由需求驱动的 API 测试生成。每一项都能落到团队自己的仓库、工具契约或基于 OpenAPI 的服务上做试点。