Repo-aware token budget controller for coding-agent runs
使用编码代理的工程团队需要在长流程运行前设置成本门槛,并在反复查看和编辑文件时强制停止。证据已经不再只是对昂贵代理的含糊抱怨。在 OpenHands 的 SWE-bench Verified 上,agentic coding 的 token 消耗大约是单轮代码推理的 3500 倍,是多轮代码聊天的 1200 倍;同一任务的不同运行之间,差距最高可达 30 倍。论文把最差的失败归因于重复搜索行为,尤其是反复访问文件和编辑,并且显示模型在开始前很难预测自己的 token 账单。
一个可行的方案是做一个面向仓库的预算控制器,实时观察行动轨迹,在代理开始反复试探时把运行切成更小的范围。控制点很直接:统计文件打开次数、回访次数、编辑回退次数和上下文增长;一旦这些计数超过阈值,就要求更窄的子任务或人工批准。已经为自动修复 bug 或实现功能付费的团队会最先关心这个,因为他们要承担失败轨迹的成本,而且通常拿不到可靠的事前估算。
一个低成本测试是回放过去的代理轨迹,测量在重复文件抖动后提前停止,能在不降低通过率的情况下减少多少 token 消耗。如果这个控制器主要拦住的是失败和后期游走,它就值得作为编码代理产品里的默认保护措施。