---
source: arxiv
url: https://arxiv.org/abs/2607.02337v1
published_at: '2026-07-02T15:43:21'
authors:
- Charlotte Brandebusemeyer
- Kerim Zunic
- Thomas Zimmermann
- Tobias Schimmer
- Bert Arnrich
topics:
- developer-experience
- github-copilot
- code-intelligence
- human-ai-interaction
- mixed-methods-study
relevance_score: 0.72
run_id: materialize-outputs
language_code: zh-CN
---

# Developers' Experience with Generative AI Beyond Productivity Assessment -- Insights from an Empirical Mixed-Methods Field Study

## Summary
## 摘要
本文研究 22 名 SAP 开发者在真实工作中如何使用生成式 AI 编程工具，重点关注工作负荷、满意度和交互方式，而不只看生产力。

## 问题
- 以往研究主要衡量代码质量或任务速度，因此容易漏掉开发者在日常工作中使用 GitHub Copilot 和类似工具时的体验。
- 组织需要了解 GenAI 何时能帮助开发者，何时会增加审查工作、认知负荷或工作流阻力。
- 本文关注交互类型，包括代码内建议和聊天提示，因为不同任务可能需要不同的工具行为。

## 方法
- 研究跟踪了 22 名 SAP 员工 4 天，第 1 天和最后 1 天进行受控环节，中间是正常工作。
- 受控任务覆盖 6 种任务类型：编码、调试、代码文档、单元测试、摘要和头脑风暴。
- 研究人员结合了问卷、NASA-TLX 工作负荷评分、屏幕录像、键盘和鼠标日志以及腕带生理数据；本文重点使用问卷和屏幕录像。
- GitHub Copilot 是受控环节使用的工具，默认模型是 GPT-4o，默认聊天模式是 ask 模式。
- 分析比较了不使用 Copilot、代码内建议、聊天提示，以及在同一任务中组合使用这些方式。

## 结果
- 摘录没有给出论文主要发现的定量效应大小，但报告了一项 22 名专业人员参与的现场研究，以及约 66 小时的屏幕录像。
- 参与者平均有 5 到 10 年 IT/编程经验；该群体包括 12 名软件开发者/工程师、8 名高级软件开发者/工程师、1 名高级质量专家和 1 名首席软件架构师。
- 开发者总体上对 GenAI 满意，尤其是在单调、重复和结构化任务中。
- 论文称，代码内建议和聊天提示在单独使用时都能提高任务效率，并降低感知工作负荷。
- 根据报告的发现，在一个任务内组合使用代码内建议和聊天提示会减少收益。
- 对于开发密集型任务，感知认知负荷来自与 AI 的交互，而感知生产力取决于 AI 输出质量。

## Problem

## Approach

## Results

## Link
- [https://arxiv.org/abs/2607.02337v1](https://arxiv.org/abs/2607.02337v1)
