来源笔记

The Usefulness of AI Agents

这篇文章认为,AI 代理在编码工作中有明确价值,但在更广泛场景中的用处比当前的采用压力所暗示的更窄。文章把代理描述为提速工具:它们可以减少一部分数字劳动,同时增加监督、伦理和人的自主性成本。

  • 文章讨论了管理者、研究人员和开发者在没有清楚说明价值、成本或人类控制方式的情况下,仓促采用 AI 代理的问题。
  • 这个问题重要,因为代理可以加快软件和研究工作流,但也可能产出低价值内容、增加 token 使用量,并减少人类对决策的参与。
  • 作者还提出了版权、劳动剥削、能源使用,以及当 AI 系统可以大规模复用公开材料时,开放在线分享可能受损等风险。
  • 作者采用反思性文章形式,没有做对照实验或基准测试研究。
  • 在大约 2 年研究 LLM 驱动代理的基础上,他比较了自己在日常生活、写作、编码和研究任务中的使用情况。
  • 对于软件工作,他报告测试了 GitHub Copilot、OpenAI Codex、Claude Code 和 Goose,并搭配了不同的 LLM 后端。
  • 他提出了限制性编码代理指令:每次请求最多修改 1-2 个文件,保持编辑范围集中,避免未经请求的重构,编码前说明计划,对超过 100 行或涉及多个文件的改动先请求批准。
  • 对于研究自动化,他描述了使用 OpenAI Codex、GPT-5.4 和 extra-high reasoning effort 来收集数据、分析数据、起草讨论部分,并编译出类似论文的 PDF。
  • 摘录没有报告基准指标、对照比较或定量突破结果。
  • 2025 年秋季,作者认为编码代理难以驾驭:它们生成太多代码,让项目更难管理;当时他更偏好行内自动补全。
  • 到写作时,他说编码代理已经改进到可以构建较小的原型和项目,同时保留他想要的监督方式。
  • 在这些限制性提示规则下,编码代理更适合他的工作流,尤其是在限制为 1-2 个文件,并且超过 100 行改动前需要审批时。
  • 在研究任务中,使用 GPT-5.4 的 Codex 可以在没有人工干预的情况下生成连贯的论文、分析脚本、图、表、讨论部分和 PDF,但作者认为这些输出作为研究并不有趣,或质量偏弱。
  • 最有力的说法是定性的:AI 代理可以让数字工作更快,尤其是编程和数据分析准备工作,但文章认为,证据不足以说明它们能带来更好的判断、更高的研究价值或更好的生活质量。