深度学习概述
00:00
深度学习发展历程、核心概念、与机器学习的关系、应用领域。
1. 深度学习定义与定位
深度学习是机器学习的一个子集,通过多层神经网络自动学习数据的层次化表示。
人工智能 ⊃ 机器学习 ⊃ 深度学习
AI → ML → DL
从规则到统计到表示学习
1.1 深度学习 vs 传统机器学习
| 维度 | 传统ML | 深度学习 |
|---|---|---|
| 特征工程 | 手动设计 | 自动学习 |
| 数据量 | 小~中 | 大 |
| 计算资源 | CPU即可 | GPU/TPU |
| 可解释性 | 较好 | 较差 |
| 非结构化数据 | 需预处理 | 原生支持 |
| 性能上限 | 受特征质量限制 | 随数据量增长 |
1.2 表示学习
深度学习的核心是自动学习层次化表示:
原始像素 → 边缘 → 纹理 → 部件 → 物体 → 场景
(低层) (高层)
每一层学习越来越抽象的特征,无需人工设计。
2. 发展历程
2.1 关键里程碑
| 年代 | 事件 | 意义 |
|---|---|---|
| 1943 | McCulloch-Pitts神经元 | 人工神经元模型 |
| 1958 | 感知机(Rosenblatt) | 第一个神经网络 |
| 1969 | 感知机局限性(Minsky) | 第一次AI寒冬 |
| 1986 | 反向传播算法(Rumelhart) | 训练多层网络 |
| 1989 | LeNet(LeCun) | 第一个CNN |
| 1998 | LSTM(Hochreiter) | 解决长程依赖 |
| 2006 | 深度信念网络(Hinton) | 深度学习复兴 |
| 2012 | AlexNet(ImageNet) | 深度学习爆发 |
| 2014 | GAN(Goodfellow) | 生成模型突破 |
| 2017 | Transformer(Vaswani) | 注意力机制革命 |
| 2018 | BERT(Google) | 预训练模型时代 |
| 2020 | GPT-3 | 大语言模型 |
| 2022 | ChatGPT | AI全民化 |
| 2023+ | LLaMA、GPT-4 | 开源与多模态 |
2.2 三次浪潮
- 第一次(1940s-1960s):感知机时代,单层网络
- 第二次(1980s-1990s):反向传播时代,多层网络但算力不足
- 第三次(2006-至今):深度学习时代,大数据+GPU+算法突破
3. 核心概念
3.1 神经网络基本组成
| 组件 | 说明 |
|---|---|
| 神经元 | 加权求和 + 激活函数 |
| 层 | 神经元的集合 |
| 权重 | 连接强度参数 |
| 偏置 | 阈值参数 |
| 激活函数 | 引入非线性 |
| 损失函数 | 衡量预测误差 |
| 优化器 | 更新参数的算法 |
3.2 训练过程
1. 前向传播: 输入 → 各层计算 → 输出
2. 计算损失: 比较输出与真实标签
3. 反向传播: 计算损失对各参数的梯度
4. 参数更新: 沿负梯度方向更新参数
5. 重复1-4直到收敛
3.3 关键技术
| 技术 | 解决的问题 |
|---|---|
| ReLU激活 | 梯度消失 |
| BatchNorm | 训练不稳定 |
| Dropout | 过拟合 |
| 残差连接 | 深层网络退化 |
| 注意力机制 | 长程依赖 |
| 预训练 | 数据不足 |
4. 应用领域
| 领域 | 任务 | 代表模型 |
|---|---|---|
| 计算机视觉 | 图像分类、检测、分割 | ResNet、YOLO、SAM |
| 自然语言处理 | 翻译、问答、生成 | BERT、GPT、LLaMA |
| 语音处理 | 识别、合成 | Whisper、VALL-E |
| 推荐系统 | 个性化推荐 | DLRM、DeepFM |
| 科学计算 | 蛋白质结构预测 | AlphaFold |
| 自动驾驶 | 感知、规划 | BEVFormer |
| 游戏AI | 决策、策略 | AlphaGo、OpenAI Five |
| 生成式AI | 图像/视频/音乐生成 | DALL-E、Sora |