Coding agents are being judged on restraint, proofs, and repository discipline
Coding-agent research is testing decision quality under executable checks. FixedBench measures when agents should leave code untouched. SWE Atlas scores everyday repository work.