来源笔记

Project Kaleidoscope: Contextual, Human-Aligned Evaluation for Real-World AI Applications

AI EvaluationLLM As A JudgeHuman In The LoopContextual TestingAI Governance

Kaleidoscope 是一个可检查的工作流,用于根据具体应用的用户、政策和风险要求评估真实世界中的 AI 应用。它结合了基于角色的测试生成、可配置评分标准、人工校准以及由可靠性门控的 LLM 评判,而不是将通用基准或未经校准的自动评分视为充分依据。

  • 公共基准通常无法代表已部署应用的用户、工作流、政策、知识库和风险容忍度,而人工评估速度慢且难以扩展。
  • 团队需要可靠的功能评估,以确定应用响应是否满足本地要求,尤其是在组织和公共部门环境中。
  • 未经校准的 LLM 评判可能产生有偏或不一致的分数,因此自动化结果需要可审查的人工参考标签和本地可靠性检查。
  • 定义目标应用的配置文件,然后围绕用户角色、典型或边缘案例、知识库范围、输入风格和语言生成具有代表性的测试。
  • 允许用户选择预设评分标准,或在声明或响应层面定义自定义标准;系统为每个评判提示使用一个指标,并可将宽泛描述的标准扩展为结构化提示。
  • 通过辅助审查界面,在校准子集上收集人工标签,同时要求审查者选择评分标准标签,而不是简单接受模型建议。
  • 为每项评分标准创建 3 个候选 LLM 评判,并根据人工标签评估每个评判;只汇总本地 Macro F1 超过 0.5 的评判,采用多数投票,并公开分歧以便进行错误分析。
  • 为期 3 周的试点涵盖 4 个组织用例、8 名测试人员、约 12 次评估运行、180 个生成的测试案例,以及在 3 个应用快照上经过人工审查的 40 个输出;8 名试点用户中有 6 人完成了问卷。
  • 问卷受访者中有 83%,即 6 名用户中的 5 名表示,Kaleidoscope 帮助他们更高效地评估应用;所有受访者都表示,他们会在解读自动化结果时参考评判可靠性分数。
  • 形成性评判和评分标准实验使用了涵盖 4 个领域和 14 个评估维度的 108 对已标注问答;论文指出,在不同指标之间直接插入通用评分标准并不可靠,而在一个评判提示中合并多个评分标准维度会显著降低性能。
  • 试点反馈促成了具体的工作流调整,包括修改测试分配、增加输入风格变化、针对应用上下文稀疏的情况加入网页搜索作为依据、提供多评判指导,以及实现灵活的数据导入和导出。
  • 这些证据仍处于早期阶段,无法证明评估的正确性,也无法证明其优于人工评估或现有工具:试点未设对照、规模较小且仅限于 4 个用例,所得分数也仅适用于所选的评分标准、测试集、人工标签和可靠性阈值。