Agent harness 与分离的编码角色
最强的工程结果来自 i cat-agent。它把 GitHub issue 解决流程拆给 Explorer、Patch Editor 和 Validator 三个角色。各 agent 交换结构化事件,Validator 对 Patch Editor 隐藏测试和断言,以减少补丁过拟合。在 SWE-bench Pro 上,使用 GPT-5.4-xhigh 的 i cat-agent 解决了 67.4% 的任务,比使用同一骨干模型的 mini-SWE-agent 高 8.3 个百分点。同一篇论文报告称,在 SWE-bench Pro 上,它的平均成本低于 Claude Code。
更大的设计主题出现在 Code as Agent Harness 这篇综述中。该综述把代码视为 agent 保存状态、调用工具、规划和验证工作的地方。MCPlexer 给出了这个思路在 Model Context Protocol (MCP) 上的具体产品版本:一个小型共享工具面,配有路由、审批、审计日志、记忆、浏览器控制和工作区策略。MCPlexer 这一项没有基准证据,因此它的价值在于运营设计,而不是已测得的性能。