预训练模型

00:00
6 min Advanced 2026/6/14

BERT、GPT、LLaMA架构、预训练策略与微调技术。

1. 预训练范式

1.1 预训练-微调

大规模无标注数据 → 预训练 → 通用语言表示

小规模标注数据 → 微调 → 下游任务

1.2 预训练任务

任务说明代表模型
MLM(掩码语言模型)随机遮盖15%token预测BERT
CLM(因果语言模型)自回归预测下一个tokenGPT
NSP(下一句预测)判断两句话是否相邻BERT
SOP(句子顺序预测)判断两句话顺序是否正确ALBERT
去噪自编码重建被破坏的输入BART、T5

2. BERT

2.1 架构

BERT 基于 Transformer编码器

模型层数隐藏维度注意参数
BERT-Base1276812110M
BERT-Large24102416340M

2.2 输入表示

[CLS] Token1 Token2 ... TokenN [SEP]

输入嵌入 = Token Embedding + Segment Embedding + Position Embedding
  • [CLS]:分类token,其输出用于下游分类
  • [SEP]句子分隔符
  • Segment Embedding:区分句子A和句子B

2.3 预训练任务

MLM随机遮盖15%的token预测被遮盖的词

  • 80%替换[MASK]
  • 10%替换随机
  • 10%保持不变

NSP:判断句子B是否是句子A的下一句

2.4 微调方式

分类: [CLS]输出 → 全连接层 → 类别概率
NER:  每个token输出 → 全连接层 → 标签
QA:   起始/结束位置预测

3. GPT系列

3.1 GPT架构

GPT 基于 Transformer解码器(移除交叉注意力):

模型层数隐藏维度参数
GPT-112768117M
GPT-24816001.5B
GPT-39612288175B
GPT-4~1.8T(MoE)

3.2 In-Context Learning

GPT-3 引入上下文学习,无需微调

输入: [示例1] [示例2] [示例3] [查询]
输出: 直接生成答案

3.3 对齐技术

RLHF(基于人类反馈的强化学习

1. SFT: 监督微调
2. RM: 训练奖励模型
3. PPO: 用奖励模型指导策略优化

DPO(直接偏好优化

4. LLaMA

4.1 架构改进

改进说明
Pre-RMSNormRMSNorm替代LayerNorm
SwiGLU激活替代ReLU的FFN
RoPE位置编码旋转位置编码
GQA分组查询注意力
SwiGLU FFN

4.2 模型规格

模型层数维度参数
LLaMA-7B324096327B
LLaMA-13B4051204013B
LLaMA-70B8081926470B
LLaMA-405B12616384128405B

5. 微调技术

5.1 参数高效微调(PEFT)

方法训练参数原理
LoRA~0.1%低秩矩阵分解
QLoRA~0.1%量化+LoRA
Adapter~2%插入适配器模块
Prefix-Tuning~0.1%学习前缀向量
Prompt Tuning~0.01%学习软提示

LoRA

其中

5.2 量化

方法内存损失
FP1616bit50%极小
INT88bit75%
INT44bit87.5%
GPTQ4bit87.5%
AWQ4bit87.5%

5.3 推理优化

技术加速比说明
KV Cache2~10x缓存计算的Key/Value
Flash Attention2~4xIO感知的注意计算
vLLM2~5xPagedAttention
Speculative Decoding2~3x小模型草拟+大模型验证
Continuous Batching2~5x动态处理

知识检测

学习进度

-- 已学文档
--% 知识覆盖率

学习推荐

专注模式