在生成代码进入评审或另一个代理步骤前做置信度评分
使用编码代理的团队可以在每个生成的补丁或函数进入评审前加一个评分。Code Is More Than Text 给出了一套具体做法:把 Top-K token 熵、采样得到的伪代码计划之间的一致性,以及自生成测试的通过率结合起来。覆盖五个代码 LLM 和四个基准后,这个集成把预测隐藏测试通过情况的平均 AUROC 从 0.696 提高到 0.776。
FASE 在测试缺失或测试成本过高时提供了一个更便宜的配套检查。它采样 10 个代码解,把它们嵌入到 Qwen3-Embedding-8B 这类模型中,用最小生成树规则聚类,再对这些簇计算熵。在 HumanEval 和 BigCodeBench-hard 上,它报告的 Spearman 相关性与 Pass@1 的平均提升为 25%,成本约为基于 LLM 的语义熵的 0.3%。
实际落地时,可以在 CI 或代理路由步骤里记录这些分数,再把分数区间和真实的评审结果、单元测试失败以及回滚数据对照。低分输出可以先送去重试、补充测试,或人工评审,再让另一个代理继续处理。