计算机视觉 知识地图

模块知识结构与学习路径 | 28 篇文档 | 29 个节点 | 39 条关系

正在加载知识地图...

文档索引

3D视觉与NeRFNeRF用MLP将场景表示为连续的5D辐射场,通过体渲染从任意视角合成照片级真实图像。
3D高斯泼溅场景是数百万3D高斯的点云。每个高斯有位置、方向、缩放、不透明度和依赖视角的颜色。光栅化它们,反向传播通过光栅化,完成。
CNN从LeNet到ResNet过去三十年的每个主要CNN都是相同的卷积-非线性-下采样配方加上一个新想法。按顺序学习这些想法。
DiffusionTransformerU-Net不是扩散的秘密。用Transformer替换它,用直线路径替换噪声调度,你就有了SD3、FLUX和每个2026文本到图像模型。
OCR与文档理解OCR将图像中的文字转换为机器可读文本。文档理解在OCR之上添加布局分析和语义理解。
SAM开放词汇分割给模型一个文本提示和一张图像,获取每个匹配物体的掩码。SAM 3将此变为单次前向传播。
StableDiffusionStable Diffusion在潜在空间而非像素空间中运行扩散,使高质量图像生成在消费级GPU上可行。
世界模型与视频扩散世界模型从过去帧预测未来帧。视频扩散使预测看起来真实。两者组合是2026年机器人规划和自动驾驶的基础。
关键点与姿态姿态是一组有序的关键点。关键点检测器是热图回归器。其他都是簿记。
单目深度估计从单张2D图像估计每个像素到相机的距离。DepthAnything V2和DepthPro是2026年的生产默认。
卷积从零实现卷积是一个微小的全连接层,你在图像上滑动它,在每个位置共享相同的权重。
图像分类分类器是从像素到类别概率分布的函数。其他都是管道工程。
图像基础 — 像素、通道、色彩空间图像是光样本的张量。你将使用的每个视觉模型都从这个事实出发。
图像检索检索系统按嵌入空间中的距离排序候选。度量学习是塑造该空间使距离含义符合需求的方法。
图像生成Diffusion扩散模型通过学习逆转逐步加噪过程来生成图像。训练稳定,生成质量超越GAN。
图像生成GANGAN是两个网络——生成器和判别器——在对抗博弈中训练。生成器学习从噪声生成逼真图像。
多目标跟踪跟踪是在帧之间链接检测。SORT用IoU做。ByteTrack用置信度做。BoT-SORT用外观+运动做。
实例分割MaskRCNN实例分割为每个像素分配类别标签和实例ID。Mask R-CNN在检测之上添加一个分割掩码头。
实时边缘推理边缘推理将模型从云端搬到设备上,用量化、剪枝和蒸馏在毫秒级延迟内运行视觉模型。
开放词汇CLIPCLIP通过对比学习将图像和文本映射到共享嵌入空间,实现零样本分类和跨模态检索。
目标检测YOLO检测是分类加定位。YOLO将两者统一为单次前向传播,用网格回归取代了区域提议。
视觉TransformerViT将图像分割为patch序列,用标准Transformer处理。当数据量足够大时,它超越了所有CNN。
视觉管线项目将检测、分割和分类组合为端到端视觉管线,处理真实世界的不完美输入和边缘情况。
视觉语言模型视觉编码器将图像转换为token。MLP投影器将这些token映射到LLM的嵌入空间。语言模型完成其余工作。这个模式——ViT-MLP-LLM——就是2026年每个生产VLM。
视频理解视频是图像的时间序列。理解视频意味着建模时间依赖——从帧间运动到长程因果。
自监督视觉自监督学习从图像本身生成标签,无需人工标注。DINO和MAE是2026年视觉预训练的两大范式。
语义分割UNet分割是像素级分类。U-Net的编码器-解码器结构与跳跃连接是医学影像和密集预测的骨干架构。
迁移学习迁移学习是在别人的权重上构建,只训练你的任务所改变的部分。