前置知识: AI工程

模型路由作为成本降低原语

5 minIntermediate

理解动态模型级联如何实现20-60%成本降低同时保持质量

模型路由作为成本降低原语

动态代理评估每个请求(任务型、token长度、嵌入相似度、置信度)并将简单查询发送到便宜模型,将复杂查询升级到前沿模型。也叫模型级联。生产案例研究显示跨US/UK/EU部署在等质量下20-60%成本降低;高量SaaS上30%路由效率改进转化为六位数年度节省。2026年背景是LLM推理价格每年下降约10x——GPT-4类token从2022年底20/M降到2026年约20/M降到2026年约0.40/M。大部分下降是更好的服务堆栈(Phase 17 · 04-09),不是硬件。路由是你将价格下降转化为利润而不产品退化的方式。失败模式是便宜模型漂移:路由将40%推到更弱模型,推理任务质量下降3-5%,一个季度没人注意。用在线质量指标门控路由,不只是离线评估集。

类型: 学习 语言: Python (stdlib, toy级联路由模拟器) 前置知识: Phase 17 · 01 (托管LLM平台), Phase 17 · 19 (AI网关) 时间: ~60分钟

学习目标

  • 解释模型级联:简单查询→便宜模型,复杂查询→前沿模型。
  • 计算给定路由分布的预期成本节省。
  • 描述便宜模型漂移失败模式以及在线质量指标如何防止它。
  • 设计路由策略带置信度阈值和回退。

问题

不是每个查询都需要GPT-4级模型。“今天天气如何?“可以在GPT-3.5级模型上回答,成本1/10。“证明这个定理”需要前沿。路由是选择哪个模型处理哪个查询的决策。

概念

模型级联

  1. 代理评估请求(任务型、长度、嵌入相似度)。
  2. 如果简单(高置信度),路由到便宜模型。
  3. 如果复杂(低置信度),路由到前沿模型。
  4. 可选:如果便宜模型置信度低,升级到前沿模型。

成本节省

如果60%的查询路由到便宜模型(1/10成本):

  • 无路由:100% * 3.00/M=3.00/M = 3.00/M
  • 有路由:60% _ 0.30/M+400.30/M + 40% _ 3.00/M = 0.18+0.18 + 1.20 = $1.38/M
  • 节省:54%

便宜模型漂移

路由将越来越多查询推到便宜模型(因为它”足够好”)。推理任务质量缓慢下降3-5%。没人注意因为离线评估集不捕获真实分布。修复:在线质量指标——实时采样便宜模型输出并评分。

路由信号

  • 任务型(分类vs推理vs创意)
  • Token长度(短vs长)
  • 嵌入相似度(与已知简单/复杂查询的相似度)
  • 历史置信度(相似查询过去的模型选择)

实践

code/main.py模拟级联路由器带可配置阈值和成本模型。

输出

本课程产生outputs/skill-model-router-designer.md。给定模型目录和工作负载,设计路由策略。

练习

  1. 计算70%路由到便宜模型(1/10成本)的成本节省。
  2. 设计路由策略:3个模型(便宜/中/前沿),2个阈值。
  3. 便宜模型漂移如何检测?提出在线质量监控方案。
  4. 阅读模型级联论文。描述置信度校准方法。
  5. 你的产品有80%简单查询和20%复杂查询。路由值得工程成本吗?

关键术语

术语常见说法实际含义
模型级联”便宜先试”简单查询→便宜模型,复杂→前沿
便宜模型漂移”质量缓慢下降”路由推太多到弱模型,质量渐降
在线质量指标”实时质量检查”实时采样和评分便宜模型输出
置信度阈值”路由开关”决定查询去便宜还是前沿模型的分数

延伸阅读