Coding agents are being judged by traces, line-level evidence, and adversarial tests
Coding-agent work in this window centers on evidence-rich control: traces become training data, repository search gets line-level scoring, and evaluation adds randomized caps and runtime checks.