来源笔记

Human-AI Collaboration and the Transformation of Software Engineering Work

Human AI CollaborationAgentic Software EngineeringCode IntelligenceSoftware Engineering RolesAI Governance

论文认为,GenAI 和代码代理正在把软件工程工作推向意图定义、代理指挥、验证和治理。它的主要产出是一个基于综合分析的能力模型,不是新的编码模型或基准。

  • AI 编码助手和代理可以编写、测试、审查和提交软件变更,因此团队需要弄清楚人类工程师仍应负责什么。
  • 这个问题很重要,因为更快的代码产出会增加审查负担、安全风险、技术债务和责任缺口。
  • 现有证据分散在生产力研究、仓库研究、教育论文和治理工作中,所以本文尝试把这些发现连成一个关于工程工作变化的统一说明。
  • 作者使用结构化解释性综合,分析近期关于 GenAI、代理式 AI、软件工程角色和能力需求的同行评审与档案来源。
  • 他们比较了三种并存的工作模式:传统软件工程、GenAI 赋能的软件工程和代理式 AI 赋能的软件工程。
  • 他们把工程活动分为自动化、增强和新出现三类,然后把这些变化映射到所需的人类技能。
  • 他们提出了一个包含五类能力的能力模型:技术、认知、社会技术、治理和组织能力。
  • 他们推导出九条可检验命题,供后续实证研究使用。
  • 论文把 AIDev 研究作为关键证据:五个代理共生成了 456,535 个代理作者发起的 pull request,覆盖 61,453 个仓库和 47,303 名开发者,这五个代理是 OpenAI Codex、GitHub Copilot、Devin、Cursor 和 Claude Code。
  • 它给出一个 AIDev 例子:某个开发者在三天内产生了 164 个代理作者发起的 pull request,而在此前三年里只产生了 176 个人工作者发起的 pull request。
  • 它指出,一些代理关闭 pull request 的速度比人类快一个数量级,但代理作者发起的 pull request 被合并的频率更低,而且往往带来更少的结构性代码改动。
  • 它引用 Peng 等人的研究,称使用 AI pair programmer 的开发者在标准化任务上的完成时间快了约 56%。
  • 它还引用了一项 workshop 研究,其中有 22 名专业软件工程师使用 ChatGPT 三小时,以及一项针对 410 名开发者的 AI 编码支持调查。
  • 它声称的主要贡献是概念性的:三种工作范式、一个十维比较、一个五类能力模型,以及九条实证命题。