计算机视觉
图像分类·目标检测·图像生成
- 001 进阶 3D视觉与NeRF NeRF用MLP将场景表示为连续的5D辐射场,通过体渲染从任意视角合成照片级真实图像。
- 002 进阶 3D高斯泼溅 场景是数百万3D高斯的点云。每个高斯有位置、方向、缩放、不透明度和依赖视角的颜色。光栅化它们,反向传播通过光栅化,完成。
- 003 中级 CNN从LeNet到ResNet 过去三十年的每个主要CNN都是相同的卷积-非线性-下采样配方加上一个新想法。按顺序学习这些想法。
- 004 进阶 DiffusionTransformer U-Net不是扩散的秘密。用Transformer替换它,用直线路径替换噪声调度,你就有了SD3、FLUX和每个2026文本到图像模型。
- 005 中级 OCR与文档理解 OCR将图像中的文字转换为机器可读文本。文档理解在OCR之上添加布局分析和语义理解。
- 006 中级 SAM开放词汇分割 给模型一个文本提示和一张图像,获取每个匹配物体的掩码。SAM 3将此变为单次前向传播。
- 007 进阶 世界模型与视频扩散 世界模型从过去帧预测未来帧。视频扩散使预测看起来真实。两者组合是2026年机器人规划和自动驾驶的基础。
- 008 中级 关键点与姿态 姿态是一组有序的关键点。关键点检测器是热图回归器。其他都是簿记。
- 009 进阶 StableDiffusion Stable Diffusion在潜在空间而非像素空间中运行扩散,使高质量图像生成在消费级GPU上可行。
- 010 中级 单目深度估计 从单张2D图像估计每个像素到相机的距离。DepthAnything V2和DepthPro是2026年的生产默认。
- 011 中级 卷积从零实现 卷积是一个微小的全连接层,你在图像上滑动它,在每个位置共享相同的权重。
- 012 中级 图像分类 分类器是从像素到类别概率分布的函数。其他都是管道工程。
- 013 入门 图像基础 — 像素、通道、色彩空间 图像是光样本的张量。你将使用的每个视觉模型都从这个事实出发。
- 014 中级 图像检索 检索系统按嵌入空间中的距离排序候选。度量学习是塑造该空间使距离含义符合需求的方法。
- 015 进阶 图像生成Diffusion 扩散模型通过学习逆转逐步加噪过程来生成图像。训练稳定,生成质量超越GAN。
- 016 中级 多目标跟踪 跟踪是在帧之间链接检测。SORT用IoU做。ByteTrack用置信度做。BoT-SORT用外观+运动做。
- 017 进阶 图像生成GAN GAN是两个网络——生成器和判别器——在对抗博弈中训练。生成器学习从噪声生成逼真图像。
- 018 进阶 实例分割MaskRCNN 实例分割为每个像素分配类别标签和实例ID。Mask R-CNN在检测之上添加一个分割掩码头。
- 019 进阶 实时边缘推理 边缘推理将模型从云端搬到设备上,用量化、剪枝和蒸馏在毫秒级延迟内运行视觉模型。
- 020 中级 开放词汇CLIP CLIP通过对比学习将图像和文本映射到共享嵌入空间,实现零样本分类和跨模态检索。
- 021 进阶 目标检测YOLO 检测是分类加定位。YOLO将两者统一为单次前向传播,用网格回归取代了区域提议。
- 022 进阶 自监督视觉 自监督学习从图像本身生成标签,无需人工标注。DINO和MAE是2026年视觉预训练的两大范式。
- 023 中级 视觉Transformer ViT将图像分割为patch序列,用标准Transformer处理。当数据量足够大时,它超越了所有CNN。
- 024 进阶 视觉管线项目 将检测、分割和分类组合为端到端视觉管线,处理真实世界的不完美输入和边缘情况。
- 025 进阶 视觉语言模型 视觉编码器将图像转换为token。MLP投影器将这些token映射到LLM的嵌入空间。语言模型完成其余工作。这个模式——ViT-MLP-LLM——就是2026年每个生产VLM。
- 026 中级 视频理解 视频是图像的时间序列。理解视频意味着建模时间依赖——从帧间运动到长程因果。
- 027 中级 语义分割UNet 分割是像素级分类。U-Net的编码器-解码器结构与跳跃连接是医学影像和密集预测的骨干架构。
- 028 中级 迁移学习 迁移学习是在别人的权重上构建,只训练你的任务所改变的部分。