来源笔记

Developers' Experience with Generative AI Beyond Productivity Assessment -- Insights from an Empirical Mixed-Methods Field Study

Developer ExperienceGithub CopilotCode IntelligenceHuman AI InteractionMixed Methods Study

本文研究 22 名 SAP 开发者在真实工作中如何使用生成式 AI 编程工具,重点关注工作负荷、满意度和交互方式,而不只看生产力。

  • 以往研究主要衡量代码质量或任务速度,因此容易漏掉开发者在日常工作中使用 GitHub Copilot 和类似工具时的体验。
  • 组织需要了解 GenAI 何时能帮助开发者,何时会增加审查工作、认知负荷或工作流阻力。
  • 本文关注交互类型,包括代码内建议和聊天提示,因为不同任务可能需要不同的工具行为。
  • 研究跟踪了 22 名 SAP 员工 4 天,第 1 天和最后 1 天进行受控环节,中间是正常工作。
  • 受控任务覆盖 6 种任务类型:编码、调试、代码文档、单元测试、摘要和头脑风暴。
  • 研究人员结合了问卷、NASA-TLX 工作负荷评分、屏幕录像、键盘和鼠标日志以及腕带生理数据;本文重点使用问卷和屏幕录像。
  • GitHub Copilot 是受控环节使用的工具,默认模型是 GPT-4o,默认聊天模式是 ask 模式。
  • 分析比较了不使用 Copilot、代码内建议、聊天提示,以及在同一任务中组合使用这些方式。
  • 摘录没有给出论文主要发现的定量效应大小,但报告了一项 22 名专业人员参与的现场研究,以及约 66 小时的屏幕录像。
  • 参与者平均有 5 到 10 年 IT/编程经验;该群体包括 12 名软件开发者/工程师、8 名高级软件开发者/工程师、1 名高级质量专家和 1 名首席软件架构师。
  • 开发者总体上对 GenAI 满意,尤其是在单调、重复和结构化任务中。
  • 论文称,代码内建议和聊天提示在单独使用时都能提高任务效率,并降低感知工作负荷。
  • 根据报告的发现,在一个任务内组合使用代码内建议和聊天提示会减少收益。
  • 对于开发密集型任务,感知认知负荷来自与 AI 的交互,而感知生产力取决于 AI 输出质量。