Code confidence signals
两篇论文给出在生成代码进入更大工作流前对其打分的具体方法。《Code Is More Than Text》把 token 熵峰值、采样得到的伪代码一致性和自生成测试结合起来。在五个代码大语言模型(LLMs)和四个基准上,它的集成方法把接收者操作特征曲线下面积(AUROC)平均提高到 0.776,比最强的自然语言衍生基线高 8.1 个百分点。
FASE,即 Fast Adaptive Semantic Entropy,走的是更便宜的路线。它为每个任务嵌入 10 个代码样本,用最小生成树规则聚类,并在这些簇上计算熵。在 HumanEval 和 BigCodeBench-hard 上,Qwen3-Embedding-8B 版本报告与 Pass@1 的 Spearman 相关系数平均提升 25%,运行成本约为基于 LLM 的语义熵的 0.3%。
结构化输出控制提供了一个边界案例。Template Token Match Generation 几乎消除了 JSON、SQL、代码和函数调用中的语法错误,但模式错误和值错误仍然存在。格式控制能帮助流水线解析输出;它不能证明生成的产物就是正确的那个。