AI工程 知识地图

模块知识结构与学习路径 | 149 篇文档

该模块暂无知识地图

文档索引

AI的SRE — 多Agent事件响应、Runbook与预测检测 理解2026年AI SRE的多Agent编排架构和预测检测前沿
AI网关 — LiteLLM、Portkey、Kong AI Gateway、Bifrost 比较2026年四大AI网关的定位、性能和适用场景
DevOps故障排查代理Kubernetes 2026年SRE叙事:AI代理分类事件,人类批准修复。AWS DevOps Agent、Resolve AI、NeuBird、Metoro都发布此形态。告警webhook触发,代理读取遥测,遍历K8s对象图,排序根因假设,发布带审批按钮的Slack简报。默认只读,每次修复需人工批准。
API与密钥 安全存储 API 密钥,使用 Anthropic Python SDK 和原始 HTTP 调用 LLM API,比较 SDK 和原始 HTTP 格式,处理常见 API 错误
Docker与AI 构建 GPU 支持的 Docker 镜像,挂载卷持久化模型和数据,配置 NVIDIA Container Toolkit,使用 Docker Compose 编排多服务 AI 应用
EAGLE-3投机解码:树验证器方法 理解EAGLE-3如何通过树状投机和自验证实现2.5-3.5x推理加速
GPU与云计算 验证本地 GPU 可用性,配置 Google Colab T4 GPU,基准测试 CPU vs GPU 矩阵乘法,估算 VRAM 可容纳的最大模型
Kubernetes上的GPU自动伸缩 — Karpenter、KAI调度器、Gang调度 理解三层GPU自动伸缩架构:节点供给、Gang调度和应用层信号
GitHub Issue到PR自主代理 AWS Remote SWE Agents、Cursor Background Agents、OpenAI Codex cloud和Google Jules都发布2026年相同产品形态:标记issue,获得PR。在云沙盒中运行代理,验证测试通过,发布带理由的review-ready PR。难点在于自动复现仓库构建环境、防止凭证泄露、强制每仓库预算、确保代理不能force-push。构建自托管版本并在成本和通过率上与托管替代比较。
Git与协作 配置 Git 身份,掌握日常 add/commit/push 工作流,创建和合并分支,编写 .gitignore,浏览提交历史
JAX入门 JAX用函数式编程和XLA编译实现高性能数值计算和自动微分
Jupyter笔记本 安装和启动 JupyterLab,使用魔法命令进行基准测试和可视化,区分笔记本与脚本的使用场景,避免常见笔记本陷阱
KNN与距离度量 K近邻算法通过找最近的邻居来分类,距离度量的选择决定了什么是"近"
LLM API负载测试 — 为什么k6和Locust会撒谎 理解传统负载测试工具在LLM场景下的两个陷阱和2026年正确工具选择
LLM的FinOps — 单位经济学与多租户归属 理解传统FinOps在LLM支出上的失效和2026年三维度归属方案
LLM功能A/B测试 — GrowthBook、Statsig与Vibes问题 理解LLM非确定性A/B测试的挑战和2026年平台选择
LLM可观测性与评估仪表板 Langfuse开源核心、Arize Phoenix发布2026 GenAI semconv映射、Helicone和Braintrust加倍每用户成本归因、Traceloop的OpenLLMetry成为事实SDK插桩。生产形态:ClickHouse存储traces、Postgres元数据、Next.js UI、eval作业(DeepEval/RAGAS/LLM-judge)在采样traces上运行。自托管构建,从至少四个SDK家族摄取,五分钟内捕获注入回归。
LLM可观测性栈选择 比较2026年LLM可观测性市场两大类别:开发平台vs网关/遥测工具
LLM生产混沌工程 理解2026年LLM混沌工程的四平面架构和LLM特定实验
Linux与AI Linux 文件系统导航,文件权限管理,apt 包管理,用户与 sudo,进程与 systemd,磁盘空间,网络传输,tmux 会话
MCP服务器与注册中心与治理 Model Context Protocol在2026年从未来变成默认工具使用规范。Anthropic、OpenAI、Google和每个主要IDE都发布MCP客户端。Pinterest发布内部MCP服务器生态。AAIF Registry在.well-known正式化能力元数据。2026年生产形态:StreamableHTTP传输、OAuth 2.1范围、OPA策略门控、注册中心让平台团队发现验证启用服务器。端到端构建。
ML流水线 ML流水线将预处理、训练和预测串联成可复现、可部署的自动化流程
Prompt缓存与语义缓存经济学 理解L2提供商级缓存和L1应用级语义缓存的两层缓存策略
PyTorch入门 PyTorch是深度学习的工业标准框架,动态计算图让调试和实验更直观
Python环境管理 使用 uv、venv、conda 创建隔离虚拟环境,编写 pyproject.toml 和 lockfile,诊断依赖冲突,实施按阶段的环境策略
SGLang与RadixAttention前缀密集工作负载 理解SGLang如何通过基数树KV缓存和缓存感知调度实现前缀共享加速
TensorRT-LLM与Blackwell FP8/NVFP4 理解Blackwell上TRT-LLM如何通过FP8+NVFP4+MTP实现7x成本优势
Whisper架构与微调 深入理解Whisper的编码器-解码器架构、分块推理和LoRA微调
vLLM服务内部:PagedAttention、连续批处理、分块预填充 深入理解vLLM三大核心优化机制及其调度器工作原理
vLLM生产栈与LMCache KV卸载 理解vLLM生产栈参考部署和LMCache跨引擎KV缓存复用
不平衡数据处理 不平衡数据中少数类才是重点,重采样和代价敏感学习让模型关注少数类
个人AI导师自适应多模态与记忆 Khanmigo (Khan Academy)、Duolingo Max、Google LearnLM/Gemini for Education、Quizlet Q-Chat和Synthesis Tutor都在2026年大规模发布自适应多模态辅导。共同形态:苏格拉底策略(永不直接给答案)、每次交互后更新的学习者模型(贝叶斯知识追踪)、语音+文本+照片数学输入、课程图检索、间隔重复调度、年龄适宜内容的硬安全过滤器。
什么是机器学习 机器学习是教计算机从数据中发现模式,而不是手工编写规则
代码库RAG与跨仓库语义搜索 2026年每个严肃工程组织都运行理解语义的内部代码搜索:tree-sitter解析、函数/类级分块、混合搜索(稠密+BM25)、重排序、带引用的回答。构建处理2M行代码跨10个仓库的系统,在每次git push时存活增量重新索引。
代码迁移代理仓库级语言与运行时升级 Amazon MigrationBench (Java 8到17)和Google App Engine Py2到Py3迁移器设定2026年标准。Moderne OpenRewrite做确定性AST重写,Grit用codemod风格DSL。生产模式结合两者:确定性基底处理安全重写+代理层处理模糊情况+沙盒逐分支构建+测试线束在PR打开前翻绿。迁移50个真实仓库并发布通过率和失败分类。
优化器 优化器决定模型如何更新参数,从SGD到Adam的演进让训练更快更稳定
优化方法 梯度下降、SGD、动量、Adam、学习率调度、凸优化与非凸优化
信息论 熵、交叉熵、KL 散度、互信息、困惑度、标签平滑
偏差方差与学习曲线 偏差方差分解解释了为什么模型会犯错,学习曲线告诉你如何修复
傅里叶变换 DFT/FFT 实现、频谱分析、卷积定理、窗函数、STFT、位置编码的联系
决策树与随机森林 决策树通过一系列是非问题分割数据,随机森林通过组合多棵树来减少过拟合
凸优化 凸集与凸函数、Hessian 判断凸性、牛顿法、拉格朗日乘子、KKT 条件、对偶性、正则化与约束优化
分离预填充/解码 — NVIDIA Dynamo与llm-d 理解预填充和解码分离如何通过独立伸缩实现30-40%成本节省
反向传播 反向传播是训练神经网络的核心算法,通过链式法则高效计算梯度
反欺骗与音频水印 理解ASVspoof 5、AudioSeal、AASIST等语音反欺骗与水印技术
合规 — SOC 2、HIPAA、GDPR、PCI-DSS、EU AI Act、ISO 42001 理解2026年多框架合规要求和跨框架映射减少审计疲劳
向量与矩阵运算 从零实现 Vector 和 Matrix 类,支持元素级运算、矩阵乘法、广播机制,理解形状约定和内存布局
图论 邻接矩阵、BFS/DFS、图拉普拉斯矩阵、谱聚类、消息传递(GNN)
复数 复数运算、欧拉公式、极坐标形式、从单位复数根推导 DFT、RoPE 位置编码的联系
多代理软件工程团队 SWE-AF工厂架构、MetaGPT角色提示、AutoGen 0.4类型化actor图、Cognition Devin和Factory Droids都收敛于2026年相同形态:架构师规划、N个编码器并行工作树、审阅者门控、测试者验证。并行工作树将挂钟时间转化为吞吐量。共享状态和交接协议成为失败面。
多区域LLM服务与KV缓存局部性 理解缓存感知路由如何避免跨区域预填充惩罚和灾难恢复陷阱
多层网络 多层网络堆叠神经元创建层次化表示,解决单层感知机无法处理的非线性问题
多模态文档QA视觉优先PDF与表格与图表 2026年文档QA前沿从OCR-then-text转向视觉优先后期交互。ColPali、ColQwen2.5和ColQwen3-omni将每页PDF视为图像,用多向量后期交互嵌入,让查询直接关注patch。在金融10-K、科学论文和手写笔记上大幅超越OCR优先方案。
奇异值分解 幂迭代法 SVD、截断 SVD、图像压缩、伪逆、LSA、PCA 与 SVD 的关系
学习率调度 学习率调度让训练先快后慢,在快速收敛和精细调优之间找到平衡
安全 — 密钥、API密钥轮换、审计日志与护栏 理解2026年LLM安全最佳实践:集中密钥库、AI网关模式、PII清洗
实时语音助手ASR到LLM到TTS 感觉正确的语音代理端到端延迟低于800ms,知道你何时停止说话,处理打断,可以在不卡顿的情况下调用工具。流式ASR、转向检测器、流式LLM和流式TTS通过WebRTC连接。构建一个,测量WER、MOS和误切率,在丢包下运行。
实时音频处理 理解实时音频的延迟预算、环形缓冲区、VAD门控和中断处理
宪法安全线束与红队靶场 Anthropic Constitutional Classifiers、Meta Llama Guard 4、Google ShieldGemma-2、NVIDIA Nemotron 3 Content Safety和X-Guard定义2026年安全分类器栈。garak、PyRIT、NVIDIA Aegis和promptfoo成为标准对抗评估工具。NeMo Guardrails v0.12将它们绑入生产管线。将所有这些连接在一起:围绕目标应用的分层安全线束、运行6+攻击族的自主红队代理、产生可测量无害增量的宪法自我批评运行。
开发环境搭建 搭建 Python、Node.js、Rust 工具链,配置虚拟环境和包管理器,验证 GPU 访问,理解四层技术栈
异常检测 异常检测在数据中找到不寻常的模式,从欺诈检测到设备故障预警
张量运算 Tensor 类实现、步幅与 reshape、广播机制、einsum 表达式、用 einsum 实现注意力机制
影子流量、金丝雀发布与LLM渐进式部署 理解LLM部署的三阶段策略:影子→金丝雀→A/B测试
感知机 感知机是最简单的神经网络,一个神经元学会画一条线分割两类数据
托管LLM平台 — Bedrock、Vertex AI、Azure OpenAI 比较三大超大规模云平台的LLM服务策略、延迟差距和FinOps归属
批量API — 50%折扣成为行业标准 理解批量API的经济学和三车道工作负载分类法
投机解码推理服务器 EAGLE-3在vLLM 0.7中在真实流量上提供2.5-3x吞吐。P-EAGLE (AWS 2026)进一步推进并行推测。SGLang SpecForge大规模训练草稿头。Red Hat Speculators hub发布常见开放模型的对齐草稿。2026年生产服务栈是vLLM或SGLang + EAGLE族草稿 + FP8/INT4量化 + HPA on queue-wait。以2.5x+基线吞吐服务两个开放模型并发布完整尾延迟报告。
损失函数 损失函数衡量预测与真实值的差距,选择正确的损失函数是训练成功的关键
推理指标 — TTFT、TPOT、ITL、Goodput、P99 掌握推理服务的核心指标体系,从延迟分解到Goodput复合SLO
支持向量机 SVM找到最宽的街道来分隔类别,用核技巧处理非线性边界
推理平台经济学 — Fireworks、Together、Baseten、Modal、Replicate、Anyscale 比较六大推理平台的定价模型、市场定位和成本效益
数值稳定性 IEEE 754 浮点数、溢出与下溢、log-sum-exp 技巧、稳定 softmax、梯度检查、混合精度、bfloat16
数据管理 使用 Hugging Face datasets 加载和流式处理数据集,在 CSV/JSON/Parquet/Arrow 格式间转换,创建可复现的数据分割,管理大文件
文本转语音 从Tacotron到F5和Kokoro,理解现代TTS的三段式架构
无服务器LLM冷启动缓解 理解五层冷启动缓解策略:预置镜像、模型流式加载、GPU快照、温池和分层加载
无监督学习 无监督学习在没有标签的数据中发现隐藏结构,包括聚类和降维
时间序列 时间序列分析处理随时间变化的数据,捕捉趋势、季节性和自相关
朴素贝叶斯 朴素贝叶斯用条件概率和"朴素"独立性假设实现快速分类
机器学习微积分 导数、偏导数、梯度、链式法则、Hessian 矩阵、Taylor 级数、积分在机器学习中的应用
机器学习统计 描述性统计、相关性、假设检验、t 检验、卡方检验、Bootstrap、A/B 测试
权重初始化 好的权重初始化让训练从正确的起点开始,避免梯度消失和爆炸
概率与分布 PMF/PDF、常见分布、期望值、中心极限定理、对数概率、softmax、交叉熵
模型评估 模型评估告诉你模型是否真正有效,而不仅仅是看起来有效
模型路由作为成本降低原语 理解动态模型级联如何实现20-60%成本降低同时保持质量
正则化 正则化防止神经网络过拟合,从Dropout到权重衰减的多种策略
流式语音对话 理解Moshi、Hibiki的全双工架构和Mimi编解码token上的流式语音对话
激活函数 激活函数引入非线性,决定了神经元如何将输入转化为输出
特征工程与选择 特征工程将原始数据转化为模型可用的信号,好的特征胜过好的算法
特征选择进阶 特征选择移除噪声和冗余特征,让模型更快更准更可解释
生产RAG聊天机器人监管垂直领域 Harvey、Glean、Mendable和LlamaCloud在2026年运行相同生产形态:docling/Unstructured + ColPali摄取、混合搜索、bge-reranker-v2-gemma重排序、Claude Sonnet 4.7合成(60-80%提示缓存命中)、Llama Guard 4 + NeMo Guardrails防护、Langfuse/Phoenix监控、RAGAS评估。在监管领域(法律、临床、保险)构建,通过金集、红队和漂移仪表板。
生产量化 — AWQ、GPTQ、GGUF K-quants、FP8、MXFP4/NVFP4 理解量化格式选择是硬件、服务引擎和工作负载的函数,而非通用选择
矩阵变换 旋转、缩放、剪切、反射矩阵,特征值与特征向量,特征值分解,对称矩阵的性质
神经音频编解码 理解EnCodec、SNAC、Mimi、DAC和语义-声学分离的核心架构
端到端微调管线从数据到SFT到DPO到服务 8B模型用自有数据训练、DPO对齐自有偏好、量化、投机解码、以可测量的$/1M tokens服务。2026年开源栈:Axolotl v0.8、TRL 0.15、Unsloth迭代、GPTQ/AWQ/GGUF量化、vLLM 0.7 + EAGLE-3服务。YAML输入,服务端点输出,可重现全管线。
线性代数直觉 向量、矩阵、点积、线性独立、秩、投影、Gram-Schmidt 正交化的直觉理解与 Python 实现
线性回归 线性回归通过数据画出最佳拟合直线,是机器学习的"Hello World"
线性系统 高斯消元、LU/QR/Cholesky 分解、最小二乘、正规方程、条件数、共轭梯度
终端与Shell 使用管道和 grep 过滤训练日志,创建 tmux 持久会话,监控系统与 GPU 资源,通过 SSH/scp/rsync 传输文件
终端原生编码代理 2026年编码代理的架构已定型:TUI线束、有状态计划、沙盒工具面、计划-行动-观察循环。从CLI到Pull Request端到端构建,在SWE-bench Pro上测量。难点不在模型调用而在工具循环、沙盒和成本上限。
编辑器配置 安装 VS Code 及 Python/Jupyter/Remote SSH 扩展,配置格式化保存和类型检查,设置远程 SSH 开发,评估编辑器替代方案
自主研究代理AI-Scientist级 Sakana AI-Scientist-v2发表了完整论文,Agent Laboratory运行实验。2026年形态是计划-执行-验证树搜索:预算成本、沙盒代码执行、视觉反馈LaTeX编写器、自动化NeurIPS风格审稿人集成。构建一个,每篇论文$30内端到端运行,存活Sakana记录的沙盒逃逸红队。
自托管服务选择 — llama.cpp、Ollama、TGI、vLLM、SGLang 比较2026年五大自托管推理引擎的定位和选择决策树
范数与距离 L1/L2/Lp 范数、余弦相似度、Mahalanobis 距离、Jaccard 距离、编辑距离、KL 散度、Wasserstein 距离、近似最近邻搜索
视频理解管线场景与QA与搜索 Twelve Labs产品化Marengo+Pegasus,VideoDB发布视频CRUD API,AI2 Molmo 2发布开放VLM检查点,Gemini长上下文原生处理小时级视频。2026年管线:场景分割、每场景字幕+嵌入、转录对齐、多向量索引、带(start,end)时间戳+帧预览的查询回答。摄取100小时,命中公开基准,测量计数和动作问题的幻觉。
语音克隆与转换 理解零样本克隆、语音转换和水印合规的完整技术栈
语音助手流水线 构建端到端语音助手,整合VAD、ASR、LLM、TTS和中断处理
语音活动检测 理解VAD级联、轮次检测和刷新技巧的完整技术栈
语音识别ASR 理解CTC、RNN-T和注意力机制三种语音识别范式
说话人识别与验证 从i-vector到ECAPA-TDNN和WavLM,理解说话人识别的嵌入与评分
调试与性能分析 使用 breakpoint 和 debug_print 检查张量,使用 cProfile 和 line_profiler 分析性能瓶颈,检测常见 AI Bug,配置 TensorBoard
调试神经网络 调试神经网络是系统化的过程,从数据到模型到训练循环逐一排查问题
贝叶斯定理 贝叶斯定理、朴素贝叶斯分类器、MLE 与 MAP、共轭先验、A/B 测试
超参数调优 超参数调优找到模型的最佳设置,网格搜索、随机搜索和贝叶斯优化各有优劣
边缘推理 — Apple Neural Engine、Qualcomm Hexagon、WebGPU、Jetson 理解边缘推理的内存带宽约束和四大平台方案
迷你框架 构建一个迷你深度学习框架,整合前向传播、反向传播、优化器和训练循环
逻辑回归与分类 逻辑回归将直线弯成S曲线,用概率回答是非问题
采样方法 逆 CDF 采样、拒绝采样、重要性采样、MCMC、温度/top-k/top-p 采样、重参数化技巧、Gumbel-Softmax
链式法则与自动微分 链式法则、计算图、前向模式与反向模式自动微分、Value 类实现(micrograd)、从零构建 MLP
降维 PCA 从零实现、t-SNE、UMAP、核 PCA、解释方差、重建误差
随机过程 随机游走、马尔可夫链、布朗运动、Langevin 动力学、MCMC、扩散模型
集成方法 集成方法组合多个弱学习器创建强学习器,三个臭皮匠顶个诸葛亮
音乐生成 从MusicGen到Suno,理解音乐生成的Token LM与扩散两条路线
音频分类 从MFCC上的k-NN到AST和BEATs,理解音频分类的完整技术栈
音频评估指标 理解WER、MOS、UTMOS、MMAU、FAD、EER等2026年音频评估指标体系
音频基础 从声波到数字信号,理解音频的物理基础与数字表示
频谱图与Mel特征 从STFT到Mel频谱图,理解音频AI最核心的特征表示
音频语言模型 理解Qwen2.5-Omni、Audio Flamingo等音频语言模型的架构与评估
机器学习概述 机器学习基本概念、学习范式分类、核心术语与工作流程。
深度学习概述 深度学习发展历程、核心概念、与机器学习的关系、应用领域。
神经网络基础 感知机、激活函数、前向传播、损失函数与梯度下降。
反向传播算法 链式法则、计算图、梯度计算与常见优化器。
逻辑回归 逻辑回归原理、Sigmoid函数、交叉熵损失、多分类扩展与正则化。
决策树 决策树算法原理、ID3/C4.5/CART算法对比、信息增益、剪枝策略。
卷积神经网络 CNN原理、卷积/池化操作、经典架构LeNet/AlexNet/VGG/ResNet详解。
循环神经网络 RNN原理、LSTM门控机制、GRU、序列建模与应用。
Transformer架构 自注意力机制、多头注意力、位置编码与Transformer架构详解。
K近邻 K近邻算法原理、距离度量、K值选择、KD树加速与优缺点分析。
生成模型 GAN、VAE、Diffusion Model生成模型原理与对比。
集成学习 集成学习原理、Bagging/Boosting框架、Random Forest/AdaBoost/GBDT/XGBoost/LightGBM详解。
预训练模型 BERT、GPT、LLaMA架构、预训练策略与微调技术。
PyTorch框架 PyTorch核心概念:Tensor、Autograd、nn.Module、训练循环与最佳实践。
聚类算法 K-Means、DBSCAN、层次聚类原理与对比,聚类评估指标。
TensorFlow框架 TensorFlow/Keras核心概念、Eager Mode、SavedModel与部署。
降维算法 PCA、t-SNE、UMAP降维原理、数学推导与应用场景对比。
模型优化与部署 模型量化、剪枝、知识蒸馏、ONNX、TensorRT部署优化。
模型评估与选择 交叉验证、混淆矩阵、ROC/AUC、偏差方差分解与模型选择策略。
特征工程详解 特征选择、特征提取、特征构造方法与自动化特征工程。
强化学习基础 MDP框架、Q-Learning、DQN、Policy Gradient算法原理与实现。
Scikit-learn实战 Scikit-learn Pipeline、模型选择、超参调优与最佳实践。
专注模式