---
source: arxiv
url: https://arxiv.org/abs/2607.14673v1
published_at: '2026-07-16T07:38:39'
authors:
- Leanne Tan
- Rohan Jaggi
- Shaun Khoo
- Roy Ka-Wei Lee
topics:
- ai-evaluation
- llm-as-a-judge
- human-in-the-loop
- contextual-testing
- ai-governance
relevance_score: 0.63
run_id: materialize-outputs
language_code: zh-CN
---

# Project Kaleidoscope: Contextual, Human-Aligned Evaluation for Real-World AI Applications

## Summary
## 摘要
Kaleidoscope 是一个可检查的工作流，用于根据具体应用的用户、政策和风险要求评估真实世界中的 AI 应用。它结合了基于角色的测试生成、可配置评分标准、人工校准以及由可靠性门控的 LLM 评判，而不是将通用基准或未经校准的自动评分视为充分依据。

## 问题
- 公共基准通常无法代表已部署应用的用户、工作流、政策、知识库和风险容忍度，而人工评估速度慢且难以扩展。
- 团队需要可靠的功能评估，以确定应用响应是否满足本地要求，尤其是在组织和公共部门环境中。
- 未经校准的 LLM 评判可能产生有偏或不一致的分数，因此自动化结果需要可审查的人工参考标签和本地可靠性检查。

## 方法
- 定义目标应用的配置文件，然后围绕用户角色、典型或边缘案例、知识库范围、输入风格和语言生成具有代表性的测试。
- 允许用户选择预设评分标准，或在声明或响应层面定义自定义标准；系统为每个评判提示使用一个指标，并可将宽泛描述的标准扩展为结构化提示。
- 通过辅助审查界面，在校准子集上收集人工标签，同时要求审查者选择评分标准标签，而不是简单接受模型建议。
- 为每项评分标准创建 3 个候选 LLM 评判，并根据人工标签评估每个评判；只汇总本地 Macro F1 超过 0.5 的评判，采用多数投票，并公开分歧以便进行错误分析。

## 结果
- 为期 3 周的试点涵盖 4 个组织用例、8 名测试人员、约 12 次评估运行、180 个生成的测试案例，以及在 3 个应用快照上经过人工审查的 40 个输出；8 名试点用户中有 6 人完成了问卷。
- 问卷受访者中有 83%，即 6 名用户中的 5 名表示，Kaleidoscope 帮助他们更高效地评估应用；所有受访者都表示，他们会在解读自动化结果时参考评判可靠性分数。
- 形成性评判和评分标准实验使用了涵盖 4 个领域和 14 个评估维度的 108 对已标注问答；论文指出，在不同指标之间直接插入通用评分标准并不可靠，而在一个评判提示中合并多个评分标准维度会显著降低性能。
- 试点反馈促成了具体的工作流调整，包括修改测试分配、增加输入风格变化、针对应用上下文稀疏的情况加入网页搜索作为依据、提供多评判指导，以及实现灵活的数据导入和导出。
- 这些证据仍处于早期阶段，无法证明评估的正确性，也无法证明其优于人工评估或现有工具：试点未设对照、规模较小且仅限于 4 个用例，所得分数也仅适用于所选的评分标准、测试集、人工标签和可靠性阈值。

## Problem

## Approach

## Results

## Link
- [https://arxiv.org/abs/2607.14673v1](https://arxiv.org/abs/2607.14673v1)
