来源笔记
Mitigating Prompt-Induced Cognitive Biases in General-Purpose AI for Software Engineering
摘要
本文研究仅靠措辞是否会把通用人工智能系统推向更差的软件工程决策,以及简单的提示词设计能否修正这种偏差。主要结果是,常见提示技巧作用不大,而加入明确的软件工程最佳实践规则后,偏差敏感性平均下降约 51%。
问题
- 论文关注软件工程决策支持中的提示诱发认知偏差:即使任务逻辑不变,模型也会因为框架、流行度暗示或事后诸葛亮式线索等带偏的措辞而改变答案。
- 这很重要,因为很多软件工程任务本身就是自然语言形式的需求、权衡问题、设计选择和优先级提示,措辞的微小变化就可能把模型推向更差的决策。
- 文中引用的先前 PROBE-SWE 结果显示,八类偏差的敏感性在 5.9% 到 35.3% 之间,更复杂任务上可达 49%。
方法
- 作者使用 PROBE-SWE,这是一个成对的基准,包含带偏差和不带偏差的软件工程难题,两者逻辑匹配,用来隔离只由措辞引起的答案变化。
- 他们在 GPT、LLaMA 和 DeepSeek 系列的低成本模型上测试了几种现成提示方法:思维链、命令式自去偏、模仿式自去偏,以及含义提示。
- 他们的核心想法是,软件工程决策需要明确的背景规则,比如最佳实践,但带偏的措辞会让模型跳过这些默认规则,直接走捷径。
- 为了对抗这种情况,他们引入了公理化背景自提取和公理化推理提示:在模型回答前,把简短、陈述式的软件工程规则加入提示词。
- 他们还做了输出语言的主题分析,找出与更高偏差敏感性相关的语言模式,并提到对开放式答案的稳健性检查以及对 DevGPT 语料库的分析。
结果
- 在 RQ1 上,常见提示方法并不能可靠解决问题。思维链的平均敏感性最差,为 16.1%,高于无策略基线的 12.9%。
- 含义提示的平均敏感性为 13.3%,也高于基线。
- **命令式自去偏(10.3%)和模仿式自去偏(10.2%)**都优于基线,它们的组合 BW+IsD 达到 8.3%,比 12.9% 的基线下降 4.6 个百分点。
- 即使有这个下降,论文仍然指出,经过 FDR 校正后,BW+IsD、BW 或 IsD 单独使用时,在单个偏差类型上的下降都没有统计显著性(全部 p >= 0.07),单个模型层面的改进也不显著。
- 论文主张的核心突破是公理化提示方法,它使总体偏差敏感性平均下降约 51%(p < .001)。
- 对某些偏差类型,下降幅度最高可达 73%。摘要没有给出该公理化方法完整的分偏差表,但这些是文中明确给出的最强定量结论。