---
source: hn
url: https://avriz.io/eng/paper
published_at: '2026-07-12T22:39:40'
authors:
- rezat
topics:
- llm-routing
- contextual-bandits
- code-agents
- production-ml
- cost-optimization
relevance_score: 0.82
run_id: materialize-outputs
language_code: zh-CN
---

# We taught our platform to learn its own pricing decisions

## Summary
## 摘要
Avriz 描述了一套生产系统，用于学习每次编码代理交互应由哪个语言模型层级处理，同时在新的路由决策通过数据和安全门槛前，不让它们进入用户流量。系统结合不含内容的特征、基于账本的奖励、每个模型的线性学习器、影子评估和受限的在线策略测试。

## 问题
- 每次交互都要在回答质量和模型成本之间做权衡。输出 token 价格相差 12 倍，而许多简单请求可以使用最便宜的模型。
- 随着模型行为、价格和使用情况变化，手工调整的路由规则会逐渐失效。
- 使用历史流量训练很难，因为平台只能观察实际提供服务的模型所产生的奖励；存储消息文本还会带来隐私和数据采集成本。

## 方法
- 将模型选择视为上下文老虎机问题。每次交互由 11 个经过缩放且不含内容的特征表示，例如代码标记、回溯信号、表示难度的动词、消息长度、当前层级和租户升级率。
- 使用现有计费记录构建奖励：可用的完成结果、失败、以美分计的成本，以及交互中途的升级。系统不存储消息文本，并为每个模型层级使用一个包含 11 个权重的岭回归模型。
- 以确定性的手工难度评分器作为先验。学习策略会一直处于影子模式，直到每个动作臂达到覆盖率门槛。
- 使用每个层级的经济特征指纹检测模型、端点或价格变化。指纹变化时，受影响动作臂的权重和样本数会重置。
- 通过管理员控制的流量比例和最高层级上限逐步启用策略。由老虎机策略服务的交互会提供实测的在线策略奖励，用于与由评估器服务的交互进行比较。

## 结果
- 模型层级的批发输出 token 成本相差 12 倍，因此准确路由会直接影响经济结果。
- 实现使用 11 个特征、每个动作臂 11 个可读权重，以及覆盖五个层级的 55 个线性参数。
- 奖励会在 120 秒的稳定等待期后，按 600 秒的交互窗口回填；后续调用会在 10 分钟内复用原路由决策。
- 当学习率约为 0.05 时，固定步长 SGD 让学习器对每个动作臂保留约 20 个样本的有效记忆，因此能够跟踪价格变化。
- 报告没有提供相对于基线的总体准确率、成本降低幅度或用户质量提升数据。报告最具体的主张是提供了一条零风险部署路径：先运行影子模式，满足数据门槛，再使用可配置的流量切片和层级上限，之后学习路由才能影响用户。

## Problem

## Approach

## Results

## Link
- [https://avriz.io/eng/paper](https://avriz.io/eng/paper)
