生成软件的行为评估
一些论文通过用户依赖的行为来测试生成的软件,而不是看表面上是否完成。T2J-Bench 通过接口、数值和短训练动态三个阶段检查 PyTorch 到 JAX 的转换。最好的受控模型达到 28.9% 的 pass@1,而所有系统都把自己的成功率高估了 66.6 到 97.8 个百分点。
SCDBench 把同样的压力施加到智能合约反编译上。GPT-5.3-Codex 在一次修复后可以编译 90.3% 的合约,但最好的模型只在 600 个合约中的 42 个上完整匹配原始合约行为。Play2Code 把交互加入游戏测试信号:一个图形用户界面(GUI)代理玩浏览器游戏,把失败反馈给代码生成器,把平均 rubric pass-rate 提高到 66.8%。