Coding agents are being judged by review load, run cost, and containment
This week’s evidence treats coding agents as production systems. The strongest work measured review burden, token spend, and privilege control after agents leave single-task demos.