Cost control is now part of the coding-agent research agenda
Token 成本是这一批研究里最清楚的实际约束。最强证据来自一项在 OpenHands 上、使用八个前沿模型对 SWE-bench Verified 的轨迹研究。Agentic coding 使用的 token 约比单轮代码推理多 3500 倍,约比多轮代码聊天多 1200 倍。同一任务的成本波动也很大,运行之间最高可差 30 倍。论文把高成本失败与反复查看和编辑文件联系起来,并显示模型在执行前很难预测自己的 token 账单。另一篇论文 R2Code 给出一个具体方向:更紧的检索和更小的上下文。它在五个可追踪性数据集上平均提升 7.4% 的 F1,同时通过自适应上下文控制将 token 使用最多减少 41.7%。