Evaluation is moving past final-answer scoring
这一天的基准测试继续提出一个更严格的问题:模型是否抓住了程序意图,并且能用可核查的证据解释这种意图。CodeSpecBench 测试可执行的前置条件和后置条件,仓库级别的最佳通过率是在 500 个 SWE-bench Verified 问题上达到 20.2%。CodeRQ-Bench 则直接评估推理本身。它的 VERA 评估器在生成、总结和分类任务上都优于之前的评审器,最高提升达到 0.26 AUCROC。这个信息很直接:只看输出质量,仍然会掩盖很大的语义和推理差距。