深度学习 知识地图
模块知识结构与学习路径 | 40 篇文档 | 41 个节点 | 95 条关系
正在加载知识地图...
文档索引
BERT掩码语言建模GPT预测下一个词,BERT预测缺失的词,一句话的差异——和半个decade所有嵌入形态的应用
GPT因果语言建模BERT看两侧,GPT只看过去,三角掩码是现代AI中影响最深远的单行代码
JAX入门JAX用函数式编程和XLA编译实现高性能数值计算和自动微分
KV缓存与Flash注意力训练是并行的且受FLOP限制,推理是串行的且受内存限制,不同的瓶颈需要不同的技巧
PyTorch入门PyTorch是深度学习的工业标准框架,动态计算图让调试和实验更直观
T5与BART编码器解码器编码器理解,解码器生成,把它们放回去你就得到一个为输入→输出任务构建的模型
为什么需要TransformerRNN逐token处理,Transformer并行处理所有token,这一架构选择改变了2017年后深度学习的所有扩展曲线
优化器优化器决定模型如何更新参数,从SGD到Adam的演进让训练更快更稳定
位置编码注意力是排列不变的,三种算法——正弦、RoPE、ALiBi——以不同的方式注入位置信号
反向传播反向传播是训练神经网络的核心算法,通过链式法则高效计算梯度
多头注意力一个注意力头一次学习一种关系,八个头学习八种,头是免费的,多用一些
多层网络多层网络堆叠神经元创建层次化表示,解决单层感知机无法处理的非线性问题
学习率调度学习率调度让训练先快后慢,在快速收敛和精细调优之间找到平衡
完整Transformer注意力是主角,其他一切——残差、归一化、前馈网络、交叉注意力——是让你能深度堆叠的脚手架
感知机感知机是最简单的神经网络,一个神经元学会画一条线分割两类数据
损失函数损失函数衡量预测与真实值的差距,选择正确的损失函数是训练成功的关键
推测解码自回归解码是串行的,每个token等待前一个,推测解码打破链条:便宜模型起草N个token,昂贵模型一次前向验证所有N个
权重初始化好的权重初始化让训练从正确的起点开始,避免梯度消失和爆炸
构建Transformer项目十三节课,一个模型,没有捷径——从零构建完整decoder-only transformer并训练
正则化正则化防止神经网络过拟合,从Dropout到权重衰减的多种策略
注意力变体完整注意力是一个圆,每个token看到每个token,内存付出代价,四种变体弯曲圆的形状并回收一半成本
混合专家模型稠密70B transformer每个token激活所有参数,671B MoE每个token只激活37B并在每个基准上击败它,稀疏是十年来最重要的扩展思想
激活函数激活函数引入非线性,决定了神经元如何将输入转化为输出
视觉Transformer图像是patch的网格,句子是token的网格,同一个transformer可以处理两者
缩放定律2020年Kaplan论文说模型越大损失越低,2022年Hoffmann论文说你训练不足,计算分两个桶——参数和token——分配并不显然
自注意力从零实现注意力是一个查找表,每个词询问"谁对我重要?"——并学习答案
调试神经网络调试神经网络是系统化的过程,从数据到模型到训练循环逐一排查问题
迷你框架构建一个迷你深度学习框架,整合前向传播、反向传播、优化器和训练循环
音频Transformer与Whisper音频是频率随时间的图像,Whisper是一个吃mel频谱图并说回来的ViT
深度学习概述深度学习发展历程、核心概念、与机器学习的关系、应用领域。
神经网络基础感知机、激活函数、前向传播、损失函数与梯度下降。
反向传播算法链式法则、计算图、梯度计算与常见优化器。
卷积神经网络CNN原理、卷积/池化操作、经典架构LeNet/AlexNet/VGG/ResNet详解。
循环神经网络RNN原理、LSTM门控机制、GRU、序列建模与应用。
Transformer架构自注意力机制、多头注意力、位置编码与Transformer架构详解。
生成模型GAN、VAE、Diffusion Model生成模型原理与对比。
预训练模型BERT、GPT、LLaMA架构、预训练策略与微调技术。
PyTorch框架PyTorch核心概念:Tensor、Autograd、nn.Module、训练循环与最佳实践。
TensorFlow框架TensorFlow/Keras核心概念、Eager Mode、SavedModel与部署。
模型优化与部署模型量化、剪枝、知识蒸馏、ONNX、TensorRT部署优化。