来源笔记
We taught our platform to learn its own pricing decisions
摘要
Avriz 描述了一套生产系统,用于学习每次编码代理交互应由哪个语言模型层级处理,同时在新的路由决策通过数据和安全门槛前,不让它们进入用户流量。系统结合不含内容的特征、基于账本的奖励、每个模型的线性学习器、影子评估和受限的在线策略测试。
问题
- 每次交互都要在回答质量和模型成本之间做权衡。输出 token 价格相差 12 倍,而许多简单请求可以使用最便宜的模型。
- 随着模型行为、价格和使用情况变化,手工调整的路由规则会逐渐失效。
- 使用历史流量训练很难,因为平台只能观察实际提供服务的模型所产生的奖励;存储消息文本还会带来隐私和数据采集成本。
方法
- 将模型选择视为上下文老虎机问题。每次交互由 11 个经过缩放且不含内容的特征表示,例如代码标记、回溯信号、表示难度的动词、消息长度、当前层级和租户升级率。
- 使用现有计费记录构建奖励:可用的完成结果、失败、以美分计的成本,以及交互中途的升级。系统不存储消息文本,并为每个模型层级使用一个包含 11 个权重的岭回归模型。
- 以确定性的手工难度评分器作为先验。学习策略会一直处于影子模式,直到每个动作臂达到覆盖率门槛。
- 使用每个层级的经济特征指纹检测模型、端点或价格变化。指纹变化时,受影响动作臂的权重和样本数会重置。
- 通过管理员控制的流量比例和最高层级上限逐步启用策略。由老虎机策略服务的交互会提供实测的在线策略奖励,用于与由评估器服务的交互进行比较。
结果
- 模型层级的批发输出 token 成本相差 12 倍,因此准确路由会直接影响经济结果。
- 实现使用 11 个特征、每个动作臂 11 个可读权重,以及覆盖五个层级的 55 个线性参数。
- 奖励会在 120 秒的稳定等待期后,按 600 秒的交互窗口回填;后续调用会在 10 分钟内复用原路由决策。
- 当学习率约为 0.05 时,固定步长 SGD 让学习器对每个动作臂保留约 20 个样本的有效记忆,因此能够跟踪价格变化。
- 报告没有提供相对于基线的总体准确率、成本降低幅度或用户质量提升数据。报告最具体的主张是提供了一条零风险部署路径:先运行影子模式,满足数据门槛,再使用可配置的流量切片和层级上限,之后学习路由才能影响用户。