批量API — 50%折扣成为行业标准
00:00
理解批量API的经济学和三车道工作负载分类法
批量API — 50%折扣成为行业标准
每个主要提供商都提供异步批量API,50%折扣和约24小时周转。OpenAI、Anthropic、Google和大多数推理平台(Fireworks批量层级,Together批量)实现相同模式。批量堆叠prompt缓存,隔夜管道降至同步未缓存成本的约10%。规则极其简单:如果不是交互式的,它属于批量。内容生成管道、文档分类、数据提取、报告生成、批量标注、目录标记——任何容忍24小时延迟的东西在移到批量之前都是留在桌上的钱。2026年生产模式是将每个新LLM工作负载分为三车道:交互式(带缓存同步)、半交互式(带回退异步队列)、批量(隔夜,缓存输入堆叠)。假装交互式但容忍分钟级延迟的工作负载浪费最多。
类型: 学习 语言: Python (stdlib, toy批量vs同步成本模拟器) 前置知识: Phase 17 · 14 (Prompt与语义缓存) 时间: ~45分钟
学习目标
- 解释批量API模式:50%折扣,约24小时周转,异步提交。
- 计算批量+缓存vs同步+无缓存的成本节省。
- 将工作负载分为三车道:交互式、半交互式、批量。
- 说出规则:如果不是交互式的,它属于批量。
问题
大多数LLM工作负载不需要实时响应。内容生成、分类和提取可以等几小时。但团队默认使用同步API因为它更简单。50%折扣+缓存=约10%成本。这是10x节省。
概念
批量API模式
所有主要提供商实现相同模式:
- 提交JSONL文件带请求。
- 提供商在约24小时内处理。
- 检索结果JSONL文件。
- 50%折扣vs同步API。
三车道分类
- 交互式:同步+缓存。用户等待响应。TTFT < 2秒。
- 半交互式:异步队列带回退。用户可等几分钟。结果轮询或webhook。
- 批量:隔夜,缓存输入堆叠。24小时周转。50%折扣+缓存=约10%成本。
成本数学
同步无缓存:3.00 _ 0.2 + 0.84/M。 批量+缓存:0.15 _ 0.8 = 0.42 / $3.00 = 14%。
堆叠批量+缓存
批量请求可以使用缓存输入。如果80%的prompt是缓存前缀,批量成本进一步降低。批量+缓存=约10%的同步未缓存成本。
实践
code/main.py比较同步vs批量vs批量+缓存在不同工作负载下。
输出
本课程产生outputs/skill-batch-api-economics.md。给定工作负载,分类到车道并计算成本。
练习
- 计算1M请求/月、平均1K token输入、50%可缓存前缀的批量+缓存成本。
- 你的产品有实时聊天和每日报告。哪个去批量?
- 设计半交互式车道:用户提交查询,5分钟内获得结果。架构?
- 为什么批量API给50%折扣?提供商的经济动机是什么?
- 阅读OpenAI Batch API文档。描述提交格式和周转时间。
关键术语
| 术语 | 常见说法 | 实际含义 |
|---|---|---|
| 批量API | ”异步50%折扣” | 异步提交,约24小时周转,50%折扣 |
| 三车道 | ”工作负载分类” | 交互式/半交互式/批量分类法 |
| JSONL | ”批量格式” | 批量请求/响应的JSON Lines格式 |
| 堆叠 | ”批量+缓存” | 批量请求使用缓存输入进一步降低成本 |