来源笔记

Rethinking Software Engineering for Agentic AI Systems

Agentic AISoftware EngineeringMulti Agent OrchestrationCode VerificationHuman AI Collaboration

本文主张,软件工程应从手动编写代码转向编排 AI 智能体、验证 AI 生成的输出,并让人类对决策承担责任。这是一篇结构化文献综述和立场论文,不是新的算法或基准研究。

  • LLM 和智能体系统可以生成大量可运行代码,因此在很多工作流里,手动编写代码不再是主要瓶颈。
  • 这带来了新的瓶颈:检查 AI 生成代码是否正确、安全、可维护,并且符合需求。
  • 如果软件工程实践、教育和治理仍然围绕写代码展开,就会和 AI 辅助开发的实际方式脱节。
  • 论文对 23 篇近期来源做了结构化多声部文献综述,包括同行评审研究、预印本和专家调查。
  • 它把证据整理为四个主题:工程师角色变化、验证挑战、对生产力和质量的实证影响,以及对教育和实践的影响。
  • 在这项综合基础上,论文提出了一个围绕四项能力构建的软件工程概念模型:意图表达、系统性验证、多智能体编排和负责任的人类判断
  • 论文还概述了课程、工具、生命周期流程和职业治理需要怎样调整,团队才能在以验证为先、人在回路中的开发模式下运作。
  • 核心主张是概念性的:软件工程应围绕编排、验证和人机协作重新组织,因为代码生成正变得充足,而语义验证仍然困难。
  • 论文本身没有报告新的实验结果或新的基准。其证据来自既有研究。
  • 引用的证据包括一项包含 151 名专业开发者的对照实验,其中 AI 辅助在初始阶段把任务完成时间的中位数降低了 30.7%,但后续维护阶段在完成时间或代码质量上与对照组相比没有显著差异
  • 另一项引用的评估发现,成功率相近的系统在成本上可以相差 53 倍,工具调用次数则为 917 次对 3 次,作者用这一点说明编排质量很重要。
  • 一项引用的人机协作研究报告称,只有人类或只有 AI 时,复杂任务的解决率在 0.67% 到 18.89% 之间,而协作时达到 31.11%
  • 基于这些综合结果,论文认为工程师的稳定角色会向上移动,更多转向系统设计、验证基础设施、风险负责以及对多智能体工作流的监督。