来源笔记
Does operational privacy guidance change code generated by Qwen?
摘要
本试点研究测试不同隐私提示是否会改变 Qwen 生成的 FastAPI 代码中的隐私相关实现选择。W3C + Operational 条件产生了观测到的最强隐私特征,但样本较小且缺少运行时测试,因此结论受到限制。
问题
- 代码生成模型能够描述隐私原则,但未必能持续将其落实为后端同意验证、数据最小化、受限披露或可执行的隐私测试。
- 这一点很重要,因为生成的应用可能会处理敏感的家庭健康数据,而隐私要求必须体现在 API、模式、存储、日志记录、披露规则和测试中。
方法
- Qwen 在四种提示条件下生成相同的 FastAPI 应用:Blind、Basic、W3C 和 W3C + Operational。
- 研究通过文件提取、语法检查、静态隐私指标和对条件标签盲化的语义审查,对生成的应用、API、模型和测试进行了比较。
- W3C + Operational 提示在源自 W3C 的原则之外,加入了具体示例、字段级规则、模式、API 预期以及可测试的实现要求。
- 外部行为测试已计划开展;生成的测试被视为模型输出,而非独立验证。
结果
- 摘录未提供定量指标、数据集规模或基线分数;每种条件包含的运行次数较少。
- W3C + Operational 生成了更多隐私和同意测试,包括针对无效、缺失、已撤销、已过期或不匹配同意的负向测试。
- 它明确了 API 职责,生成了更丰富的同意记录和数据模型,并更明确地区分了接收、存储、记录日志和披露的字段。
- 它还规定了出站字段限制,并更明确地表示了目的、接收方、类别和同意状态。
- 这种表面上的优势可能源于示例、具体程度、提示长度、所要求的测试,或这些因素的组合;静态分析和语义分析无法确定运行时隐私行为,也无法证明因果关系。