趋势

编码代理研究正在测量用户负担、运行时成本和工具风险

日 · 2026-06-29 · Software Intelligence

当天最强的工作把编码代理视为需要会话级评测的长时间运行系统。SWE-Together、SWE-INTERACT 和 MirrorCode 让用户反馈、完整程序行为和计算预算进入评分。

交互式编码代理基准

两个基准把用户重新纳入软件工程评测。SWE-Together 从真实用户-代理会话中重建 109 个仓库任务,同时评分最终代码质量和 User Correction;后者衡量明确纠正和较轻的提示。Claude Opus 4.8 在已报告的运行中以 63% pass@1 领先,而参考补丁基线约为 78%。

SWE-INTERACT 显示,模糊请求和延迟给出的需求会让任务难很多。在相同的底层任务上,Opus 4.8 从单轮 50.7% 的解决率降到交互设置下的 26.7%。GPT-5.5 从 48.0% 降到 24.7%,同时每次试验成本从 $2.78 升到 $9.84。失败标签说明了问题:许多代理找到了大部分目标,之后仍会遗漏需求或引入实现 bug。

长周期重实现与真实服务成本

MirrorCode 测试代理能否只根据行为重建命令行程序。该设置向代理提供目标程序、文档和测试的仅执行访问权限,然后检查 stdout 和 stderr 是否完全匹配。Claude Opus 4.7 在 25 个目标上的平均完美解决率为 56%;其中一次运行重写了 gotree,这是一个约 16,000 行的 Go 生物信息学工具包,耗时 14 小时、花费 $251,2,001 个测试中通过了 2,000 个。

TraceLab 给出了这一目标的系统侧数据。它的轨迹覆盖 4,265 个 Claude Code 和 Codex 会话,包含 357,161 个大型语言模型(LLM)步骤和 432,510 次工具调用。中位步骤读取约 119K 个前缀 token,并写出 214 个输出 token。前缀读取占估算 API 成本的 59.5%,因此缓存策略和上下文复用是编码代理产品的关键运行问题。

工具安全与 MCP 设计

代理安全研究关注模型能够调用工具之后会发生什么。那篇越狱文章认为,对齐会改变输出概率,但不会形成硬性的执行规则;随后它把提示注入与 ReAct 风格代理联系起来,因为不受信内容和控制指令共享同一个上下文窗口。文中的例子包括能够编辑文件、运行 shell 命令,或通过账户工作流执行操作的工具使用系统。

trajeckt 是面向 Model Context Protocol(MCP)代理的具体运行时方案。它在执行前安装一个密封的承诺图,按允许的顺序和数据流规则检查每次工具调用,并默认阻止缺失承诺的调用。它的烟雾测试允许 read_databasesummarize,随后在敏感数据会流向外部接收端时,用 HTTP 403 阻止 send_email_external。另一项 MCP 模式研究给出设计建议:当可见工具数量超过 Claude Haiku 4.5 的约 10–15 个、Claude Sonnet 4 的 20–30 个后,静态工具聚合可能降低工具选择准确率。

窄范围编码任务中的可测量辅助

几篇论文收窄任务范围,并测量额外代理结构在哪些地方有用。在使用检索增强生成(RAG)的 README 生成中,单代理系统在 ROUGE-L F1 上略高于自主多代理系统,同时只使用约七分之一的 token。人工编写的计划得到评分最高的文档,但也消耗更多时间和 token。

教育论文加入了过程层面的测量。Clover 记录学生如何接受、忽略、编辑和删除 AI 代码补全建议,然后插入错误建议作为注意力检查。在一项包含 55 名 CS1 学生的研究中,tab 接受率与注意力检查失败高度相关。PyMETA 增加了一个单独的诊断基准:48,646 份 Python 提交,带有解释器生成的标签和 14 类错误分类。合在一起看,这些工作把代码辅助当作需要审计的行为,而不只是需要评分的输出。

较新机器人策略评估开始看执行机制,不能只看基准分数较早机器人 VLA 可靠性正在用 rollout、标定和安全成本来衡量