深度学习
CNN·RNN·Transformer
- 001 中级 BERT掩码语言建模 GPT预测下一个词,BERT预测缺失的词,一句话的差异——和半个decade所有嵌入形态的应用
- 002 中级 GPT因果语言建模 BERT看两侧,GPT只看过去,三角掩码是现代AI中影响最深远的单行代码
- 003 进阶 JAX入门 JAX用函数式编程和XLA编译实现高性能数值计算和自动微分
- 004 入门 PyTorch入门 PyTorch是深度学习的工业标准框架,动态计算图让调试和实验更直观
- 005 进阶 KV缓存与Flash注意力 训练是并行的且受FLOP限制,推理是串行的且受内存限制,不同的瓶颈需要不同的技巧
- 006 中级 T5与BART编码器解码器 编码器理解,解码器生成,把它们放回去你就得到一个为输入→输出任务构建的模型
- 007 中级 为什么需要Transformer RNN逐token处理,Transformer并行处理所有token,这一架构选择改变了2017年后深度学习的所有扩展曲线
- 008 中级 优化器 优化器决定模型如何更新参数,从SGD到Adam的演进让训练更快更稳定
- 009 中级 位置编码 注意力是排列不变的,三种算法——正弦、RoPE、ALiBi——以不同的方式注入位置信号
- 010 中级 反向传播 反向传播是训练神经网络的核心算法,通过链式法则高效计算梯度
- 011 中级 多头注意力 一个注意力头一次学习一种关系,八个头学习八种,头是免费的,多用一些
- 012 入门 多层网络 多层网络堆叠神经元创建层次化表示,解决单层感知机无法处理的非线性问题
- 013 中级 学习率调度 学习率调度让训练先快后慢,在快速收敛和精细调优之间找到平衡
- 014 中级 完整Transformer 注意力是主角,其他一切——残差、归一化、前馈网络、交叉注意力——是让你能深度堆叠的脚手架
- 015 入门 感知机 感知机是最简单的神经网络,一个神经元学会画一条线分割两类数据
- 016 中级 损失函数 损失函数衡量预测与真实值的差距,选择正确的损失函数是训练成功的关键
- 017 进阶 推测解码 自回归解码是串行的,每个token等待前一个,推测解码打破链条:便宜模型起草N个token,昂贵模型一次前向验证所有N个
- 018 中级 权重初始化 好的权重初始化让训练从正确的起点开始,避免梯度消失和爆炸
- 019 进阶 构建Transformer项目 十三节课,一个模型,没有捷径——从零构建完整decoder-only transformer并训练
- 020 中级 正则化 正则化防止神经网络过拟合,从Dropout到权重衰减的多种策略
- 021 进阶 注意力变体 完整注意力是一个圆,每个token看到每个token,内存付出代价,四种变体弯曲圆的形状并回收一半成本
- 022 进阶 混合专家模型 稠密70B transformer每个token激活所有参数,671B MoE每个token只激活37B并在每个基准上击败它,稀疏是十年来最重要的扩展思想
- 023 入门 激活函数 激活函数引入非线性,决定了神经元如何将输入转化为输出
- 024 中级 缩放定律 2020年Kaplan论文说模型越大损失越低,2022年Hoffmann论文说你训练不足,计算分两个桶——参数和token——分配并不显然
- 025 中级 自注意力从零实现 注意力是一个查找表,每个词询问"谁对我重要?"——并学习答案
- 026 中级 视觉Transformer 图像是patch的网格,句子是token的网格,同一个transformer可以处理两者
- 027 进阶 迷你框架 构建一个迷你深度学习框架,整合前向传播、反向传播、优化器和训练循环
- 028 进阶 调试神经网络 调试神经网络是系统化的过程,从数据到模型到训练循环逐一排查问题
- 029 中级 音频Transformer与Whisper 音频是频率随时间的图像,Whisper是一个吃mel频谱图并说回来的ViT
- 030 入门 深度学习概述 深度学习发展历程、核心概念、与机器学习的关系、应用领域。
- 031 入门 神经网络基础 感知机、激活函数、前向传播、损失函数与梯度下降。
- 032 中级 反向传播算法 链式法则、计算图、梯度计算与常见优化器。
- 033 中级 卷积神经网络 CNN原理、卷积/池化操作、经典架构LeNet/AlexNet/VGG/ResNet详解。
- 034 中级 循环神经网络 RNN原理、LSTM门控机制、GRU、序列建模与应用。
- 035 进阶 Transformer架构 自注意力机制、多头注意力、位置编码与Transformer架构详解。
- 036 进阶 生成模型 GAN、VAE、Diffusion Model生成模型原理与对比。
- 037 进阶 预训练模型 BERT、GPT、LLaMA架构、预训练策略与微调技术。
- 038 中级 PyTorch框架 PyTorch核心概念:Tensor、Autograd、nn.Module、训练循环与最佳实践。
- 039 中级 TensorFlow框架 TensorFlow/Keras核心概念、Eager Mode、SavedModel与部署。
- 040 进阶 模型优化与部署 模型量化、剪枝、知识蒸馏、ONNX、TensorRT部署优化。