证据门控执行
可靠的自动化越来越依赖模型之外的确定性控制。一项设置安全研究发现,跨生态系统的代理通常会漏掉恶意软件包来源;提示词只能帮助发现其明确提及的攻击维度,而覆盖名称、来源和版本的安装前检查弥补了大部分已观察到的差距。Proof-or-Stop 将同一原则应用于生命周期决策:只有在新鲜证据与受跟踪的源状态绑定后,“已测试”或“已完成”等声明才会推进。其门控循环在 10 个场景中记录了零次错误完成,并拒绝了测试的全部 18 类回执篡改,但评估仅限于一个模型系列和一个自托管语料库。
近期围绕工程化检查的进展正变得更加面向实际操作。当前证据支持将控制措施绑定到实际源状态、工具版本和领域规则。静态或纯文本的成功表现可能掩盖供应链、工作流和适应性方面的失败。这些研究大多范围较窄或处于早期阶段,因此确立的是具体的失败模式,而不是广泛的生产可靠性。
可靠的自动化越来越依赖模型之外的确定性控制。一项设置安全研究发现,跨生态系统的代理通常会漏掉恶意软件包来源;提示词只能帮助发现其明确提及的攻击维度,而覆盖名称、来源和版本的安装前检查弥补了大部分已观察到的差距。Proof-or-Stop 将同一原则应用于生命周期决策:只有在新鲜证据与受跟踪的源状态绑定后,“已测试”或“已完成”等声明才会推进。其门控循环在 10 个场景中记录了零次错误完成,并拒绝了测试的全部 18 类回执篡改,但评估仅限于一个模型系列和一个自托管语料库。
基准测试正将完整的可执行工作流——而不是看似合理的代码或最终答案——作为成功单位。Alipay-PIBench 测试支付集成中的端到端行为、签名与通知处理、退款保护以及业务状态一致性;提供官方领域技能后,平均评分标准通过率提高了 10.31 个百分点。StructureClaw 要求模型、验证记录、求解器输出和报告形成可追溯的链条;使用其受治理的工作流后,平均成功率从 56.8% 提高到 88.6%。Kaleidoscope 通过根据人工标注校准应用专属评判器,将这一模式扩展到已部署应用,但其证据仍来自一个未受控的四用例试点。
受控评估表明,在固定且以文本为主的环境中测得的能力无法直接迁移。在演化后的 Model Context Protocol(MCP)服务器上,GPT-5.4 和 Claude-Sonnet-4-6 的任务性能分别下降了 13.7% 和 14.4%。在使用截图等视觉证据进行仓库定位时,表现最强的代理也仅达到文件 Acc@5 38.96 和函数 Acc@10 22.45。维护工作中的证据显示出相关的范围问题:抽样的 64 个 AI/ML 问题中,有 28 个需要修改生产代码之外的内容,包括提示词、数据集、依赖项和运行时配置。因此,评估需要保留环境变化和异构工件,而不能将工作简化为静态代码快照。