前置知识: AI工程

批量API — 50%折扣成为行业标准

5 minBeginner

理解批量API的经济学和三车道工作负载分类法

批量API — 50%折扣成为行业标准

每个主要提供商都提供异步批量API,50%折扣和约24小时周转。OpenAI、Anthropic、Google和大多数推理平台(Fireworks批量层级,Together批量)实现相同模式。批量堆叠prompt缓存,隔夜管道降至同步未缓存成本的约10%。规则极其简单:如果不是交互式的,它属于批量。内容生成管道、文档分、数据提取、报告生成、批量标注、目录标记——任何容忍24小时延迟的东西在移到批量之前都是留在桌上的钱。2026年生产模式是将每个新LLM工作负载分为三车道:交互式(带缓存同步)、半交互式(带回退异步队列)、批量(隔夜,缓存输入堆叠)。假装交互式但容忍分钟级延迟的工作负载浪费最多。

类型: 学习 语言: Python (stdlib, toy批量vs同步成本模拟器) 前置知识: Phase 17 · 14 (Prompt与语义缓存) 时间: ~45分钟

学习目标

  • 解释批量API模式:50%折扣,约24小时周转,异步提交。
  • 计算批量+缓存vs同步+无缓存的成本节省。
  • 将工作负载分为三车道:交互式、半交互式、批量。
  • 说出规则:如果不是交互式的,它属于批量。

问题

大多数LLM工作负载不需要实时响应。内容生成、分和提取可以等几小时。但团队默认使用同步API因为它更简单。50%折扣+缓存=约10%成本。这是10x节省。

概念

批量API模式

所有主要提供商实现相同模式:

  1. 提交JSONL文件带请求。
  2. 提供商在约24小时内处理。
  3. 检索结果JSONL文件。
  4. 50%折扣vs同步API。

三车道分

  • 交互式:同步+缓存。用户等待响应。TTFT < 2秒。
  • 半交互式:异步队列带回退。用户可等几分钟。结果轮询或webhook。
  • 批量:隔夜,缓存输入堆叠。24小时周转。50%折扣+缓存=约10%成本。

成本数学

同步无缓存:3.00/Mtoken。同步+缓存(803.00/M token。 同步+缓存(80%命中):3.00 _ 0.2 + 0.300.8=0.30 _ 0.8 = 0.84/M。 批量+缓存:1.500.2+1.50 _ 0.2 + 0.15 _ 0.8 = 0.42/M。批量+缓存vs同步无缓存:0.42/M。 批量+缓存vs同步无缓存:0.42 / $3.00 = 14%。

堆叠批量+缓存

批量请求可以使用缓存输入。如果80%的prompt是缓存前缀,批量成本进一步降低。批量+缓存=约10%的同步未缓存成本。

实践

code/main.py比较同步vs批量vs批量+缓存在不同工作负载下。

输出

本课程产生outputs/skill-batch-api-economics.md。给定工作负载,分到车道并计算成本。

练习

  1. 计算1M请求/月、平均1K token输入、50%可缓存前缀的批量+缓存成本。
  2. 你的产品有实时聊天和每日报告。哪个去批量?
  3. 设计半交互式车道:用户提交查询,5分钟内获得结果。架构?
  4. 为什么批量API给50%折扣?提供商的经济动机是什么?
  5. 阅读OpenAI Batch API文档。描述提交格式和周转时间。

关键术语

术语常见说法实际含义
批量API”异步50%折扣”异步提交,约24小时周转,50%折扣
三车道”工作负载分交互式/半交互式/批量分
JSONL”批量格式”批量请求/响应的JSON Lines格式
堆叠”批量+缓存”批量请求使用缓存输入进一步降低成本

延伸阅读