自主智能体运行的调用前 LLM 支出预留
运行 LLM 网关的平台工程师,可以在一次智能体运行中的每个提供商请求之前加入预算决策。实际形态可以是网关钩子、sidecar 或 SDK 中间件:根据当前输入 token、有效输出上限和带版本的价格表估算最坏情况成本,然后在运行、用户、密钥等范围内原子性预留这笔金额。调用结束后,系统提交实际用量并释放未使用的预留金额。
这针对的是普通月度预算或按密钥预算容易漏掉的成本模式:智能体循环会反复发送累积上下文,到第 20 步时一次调用可能超过 50K 输入 token。智能体还需要机器可读的预算状态。Header 和 RFC 9457 problem-detail 错误可以告诉智能体何时选择更便宜的模型、裁剪上下文或干净停止。一个有用的初始测试,是用真实智能体 trace 回放并覆盖并行分支、缺失价格元数据和上下文增长,然后测量新增延迟、被阻止的调用,以及预留金额与实际花费金额。