Behavioral equivalence gates for agent-led ML codebase conversion
使用代理将 PyTorch 训练代码迁移到 JAX 的 ML 平台团队,在接受转换前应先加一个小而固定的验证器。这个门槛应检查公开训练接口、损失和梯度等数值,以及一段短的、带固定随机种子的训练轨迹。T2J-Bench 说明为什么编译测试和冒烟测试在这类工作上不够:使用 Opus 4.7 的 Claude Code 在 Spec 上的 pass@1 达到 91.1%,但在经过 Numeric 和 Behavioral 检查后,总体只剩 26.7%。所有被评估系统相对固定验证器都高估了自己的成功率,幅度在 66.6 到 97.8 个百分点之间。
一个成本较低的试点,是选一条迁移后的训练循环,限定配置、极小数据、固定随机种子,并保存源实现中的期望张量。通过条件应该是可观察的训练行为,而不是代理的报告或单个有限损失值。这能给团队提供一个可操作的验收测试,用在现代化改造中,防止悄无声息的语义漂移浪费训练轮次或污染下游实验。