在不可逆的实现决策之前设置澄清检查点
编码智能体基准的设计者应评估智能体是否会在作出依赖某项隐藏约束的实现决策之前询问该约束,而不应只奖励提问数量或需求覆盖率。ICAE-Bench 发现,恢复更多约束并不会自动提高通过率;pAI-Econ-claude 则将人的决策权集中在代价高昂、难以逆转的选择上。综合这些观察,可以为每项隐藏需求标注其最后责任检查点,例如 API、模式或架构的选择,并将及时澄清与最终测试成功和不必要的中断分开评分。可以进行一次小规模的 ICAE-Bench 重放实验,对比不受限制的提问与基于检查点访问模拟用户的方式,测量增强测试结果和实现返工量。