---
source: arxiv
url: http://arxiv.org/abs/2604.10599v1
published_at: '2026-04-12T12:08:53'
authors:
- Mamdouh Alenezi
topics:
- agentic-ai
- software-engineering
- multi-agent-orchestration
- code-verification
- human-ai-collaboration
relevance_score: 0.95
run_id: materialize-outputs
language_code: zh-CN
---

# Rethinking Software Engineering for Agentic AI Systems

## Summary
## 总结
本文主张，软件工程应从手动编写代码转向编排 AI 智能体、验证 AI 生成的输出，并让人类对决策承担责任。这是一篇结构化文献综述和立场论文，不是新的算法或基准研究。

## 问题
- LLM 和智能体系统可以生成大量可运行代码，因此在很多工作流里，手动编写代码不再是主要瓶颈。
- 这带来了新的瓶颈：检查 AI 生成代码是否正确、安全、可维护，并且符合需求。
- 如果软件工程实践、教育和治理仍然围绕写代码展开，就会和 AI 辅助开发的实际方式脱节。

## 方法
- 论文对 **23** 篇近期来源做了结构化多声部文献综述，包括同行评审研究、预印本和专家调查。
- 它把证据整理为四个主题：工程师角色变化、验证挑战、对生产力和质量的实证影响，以及对教育和实践的影响。
- 在这项综合基础上，论文提出了一个围绕四项能力构建的软件工程概念模型：**意图表达、系统性验证、多智能体编排和负责任的人类判断**。
- 论文还概述了课程、工具、生命周期流程和职业治理需要怎样调整，团队才能在以验证为先、人在回路中的开发模式下运作。

## 结果
- 核心主张是概念性的：软件工程应围绕编排、验证和人机协作重新组织，因为代码生成正变得充足，而语义验证仍然困难。
- 论文本身**没有**报告新的实验结果或新的基准。其证据来自既有研究。
- 引用的证据包括一项包含 **151** 名专业开发者的对照实验，其中 AI 辅助在初始阶段把任务完成时间的中位数降低了 **30.7%**，但后续维护阶段在完成时间或代码质量上与对照组相比**没有显著差异**。
- 另一项引用的评估发现，成功率相近的系统在成本上可以相差 **53 倍**，工具调用次数则为 **917 次对 3 次**，作者用这一点说明编排质量很重要。
- 一项引用的人机协作研究报告称，只有人类或只有 AI 时，复杂任务的解决率在 **0.67% 到 18.89%** 之间，而协作时达到 **31.11%**。
- 基于这些综合结果，论文认为工程师的稳定角色会向上移动，更多转向系统设计、验证基础设施、风险负责以及对多智能体工作流的监督。

## Problem

## Approach

## Results

## Link
- [http://arxiv.org/abs/2604.10599v1](http://arxiv.org/abs/2604.10599v1)
