模型路由作为成本降低原语
理解动态模型级联如何实现20-60%成本降低同时保持质量
模型路由作为成本降低原语
动态代理评估每个请求(任务类型、token长度、嵌入相似度、置信度)并将简单查询发送到便宜模型,将复杂查询升级到前沿模型。也叫模型级联。生产案例研究显示跨US/UK/EU部署在等质量下20-60%成本降低;高量SaaS上30%路由效率改进转化为六位数年度节省。2026年背景是LLM推理价格每年下降约10x——GPT-4类token从2022年底0.40/M。大部分下降是更好的服务堆栈(Phase 17 · 04-09),不是硬件。路由是你将价格下降转化为利润而不产品退化的方式。失败模式是便宜模型漂移:路由将40%推到更弱模型,推理任务质量下降3-5%,一个季度没人注意。用在线质量指标门控路由,不只是离线评估集。
类型: 学习 语言: Python (stdlib, toy级联路由模拟器) 前置知识: Phase 17 · 01 (托管LLM平台), Phase 17 · 19 (AI网关) 时间: ~60分钟
学习目标
- 解释模型级联:简单查询→便宜模型,复杂查询→前沿模型。
- 计算给定路由分布的预期成本节省。
- 描述便宜模型漂移失败模式以及在线质量指标如何防止它。
- 设计路由策略带置信度阈值和回退。
问题
不是每个查询都需要GPT-4级模型。“今天天气如何?“可以在GPT-3.5级模型上回答,成本1/10。“证明这个定理”需要前沿。路由是选择哪个模型处理哪个查询的决策。
概念
模型级联
- 代理评估请求(任务类型、长度、嵌入相似度)。
- 如果简单(高置信度),路由到便宜模型。
- 如果复杂(低置信度),路由到前沿模型。
- 可选:如果便宜模型置信度低,升级到前沿模型。
成本节省
如果60%的查询路由到便宜模型(1/10成本):
- 无路由:100% * 3.00/M
- 有路由:60% _ 3.00/M = 1.20 = $1.38/M
- 节省:54%
便宜模型漂移
路由将越来越多查询推到便宜模型(因为它”足够好”)。推理任务质量缓慢下降3-5%。没人注意因为离线评估集不捕获真实分布。修复:在线质量指标——实时采样便宜模型输出并评分。
路由信号
- 任务类型(分类vs推理vs创意)
- Token长度(短vs长)
- 嵌入相似度(与已知简单/复杂查询的相似度)
- 历史置信度(相似查询过去的模型选择)
实践
code/main.py模拟级联路由器带可配置阈值和成本模型。
输出
本课程产生outputs/skill-model-router-designer.md。给定模型目录和工作负载,设计路由策略。
练习
- 计算70%路由到便宜模型(1/10成本)的成本节省。
- 设计路由策略:3个模型(便宜/中/前沿),2个阈值。
- 便宜模型漂移如何检测?提出在线质量监控方案。
- 阅读模型级联论文。描述置信度校准方法。
- 你的产品有80%简单查询和20%复杂查询。路由值得工程成本吗?
关键术语
| 术语 | 常见说法 | 实际含义 |
|---|---|---|
| 模型级联 | ”便宜先试” | 简单查询→便宜模型,复杂→前沿 |
| 便宜模型漂移 | ”质量缓慢下降” | 路由推太多到弱模型,质量渐降 |
| 在线质量指标 | ”实时质量检查” | 实时采样和评分便宜模型输出 |
| 置信度阈值 | ”路由开关” | 决定查询去便宜还是前沿模型的分数 |