AI工程
涵盖数学基础、机器学习与智能体工程
- 001 中级 AI的SRE — 多Agent事件响应、Runbook与预测检测 理解2026年AI SRE的多Agent编排架构和预测检测前沿
- 002 入门 AI网关 — LiteLLM、Portkey、Kong AI Gateway、Bifrost 比较2026年四大AI网关的定位、性能和适用场景
- 003 进阶 DevOps故障排查代理Kubernetes 2026年SRE叙事:AI代理分类事件,人类批准修复。AWS DevOps Agent、Resolve AI、NeuBird、Metoro都发布此形态。告警webhook触发,代理读取遥测,遍历K8s对象图,排序根因假设,发布带审批按钮的Slack简报。默认只读,每次修复需人工批准。
- 004 入门 API与密钥 安全存储 API 密钥,使用 Anthropic Python SDK 和原始 HTTP 调用 LLM API,比较 SDK 和原始 HTTP 格式,处理常见 API 错误
- 005 中级 Docker与AI 构建 GPU 支持的 Docker 镜像,挂载卷持久化模型和数据,配置 NVIDIA Container Toolkit,使用 Docker Compose 编排多服务 AI 应用
- 006 中级 EAGLE-3投机解码:树验证器方法 理解EAGLE-3如何通过树状投机和自验证实现2.5-3.5x推理加速
- 007 入门 GPU与云计算 验证本地 GPU 可用性,配置 Google Colab T4 GPU,基准测试 CPU vs GPU 矩阵乘法,估算 VRAM 可容纳的最大模型
- 008 中级 Kubernetes上的GPU自动伸缩 — Karpenter、KAI调度器、Gang调度 理解三层GPU自动伸缩架构:节点供给、Gang调度和应用层信号
- 009 进阶 GitHub Issue到PR自主代理 AWS Remote SWE Agents、Cursor Background Agents、OpenAI Codex cloud和Google Jules都发布2026年相同产品形态:标记issue,获得PR。在云沙盒中运行代理,验证测试通过,发布带理由的review-ready PR。难点在于自动复现仓库构建环境、防止凭证泄露、强制每仓库预算、确保代理不能force-push。构建自托管版本并在成本和通过率上与托管替代比较。
- 010 入门 Git与协作 配置 Git 身份,掌握日常 add/commit/push 工作流,创建和合并分支,编写 .gitignore,浏览提交历史
- 011 进阶 JAX入门 JAX用函数式编程和XLA编译实现高性能数值计算和自动微分
- 012 入门 Jupyter笔记本 安装和启动 JupyterLab,使用魔法命令进行基准测试和可视化,区分笔记本与脚本的使用场景,避免常见笔记本陷阱
- 013 入门 KNN与距离度量 K近邻算法通过找最近的邻居来分类,距离度量的选择决定了什么是"近"
- 014 中级 LLM API负载测试 — 为什么k6和Locust会撒谎 理解传统负载测试工具在LLM场景下的两个陷阱和2026年正确工具选择
- 015 中级 LLM的FinOps — 单位经济学与多租户归属 理解传统FinOps在LLM支出上的失效和2026年三维度归属方案
- 016 中级 LLM功能A/B测试 — GrowthBook、Statsig与Vibes问题 理解LLM非确定性A/B测试的挑战和2026年平台选择
- 017 进阶 LLM可观测性与评估仪表板 Langfuse开源核心、Arize Phoenix发布2026 GenAI semconv映射、Helicone和Braintrust加倍每用户成本归因、Traceloop的OpenLLMetry成为事实SDK插桩。生产形态:ClickHouse存储traces、Postgres元数据、Next.js UI、eval作业(DeepEval/RAGAS/LLM-judge)在采样traces上运行。自托管构建,从至少四个SDK家族摄取,五分钟内捕获注入回归。
- 018 入门 LLM可观测性栈选择 比较2026年LLM可观测性市场两大类别:开发平台vs网关/遥测工具
- 019 中级 LLM生产混沌工程 理解2026年LLM混沌工程的四平面架构和LLM特定实验
- 020 入门 Linux与AI Linux 文件系统导航,文件权限管理,apt 包管理,用户与 sudo,进程与 systemd,磁盘空间,网络传输,tmux 会话
- 021 进阶 MCP服务器与注册中心与治理 Model Context Protocol在2026年从未来变成默认工具使用规范。Anthropic、OpenAI、Google和每个主要IDE都发布MCP客户端。Pinterest发布内部MCP服务器生态。AAIF Registry在.well-known正式化能力元数据。2026年生产形态:StreamableHTTP传输、OAuth 2.1范围、OPA策略门控、注册中心让平台团队发现验证启用服务器。端到端构建。
- 022 中级 ML流水线 ML流水线将预处理、训练和预测串联成可复现、可部署的自动化流程
- 023 中级 Prompt缓存与语义缓存经济学 理解L2提供商级缓存和L1应用级语义缓存的两层缓存策略
- 024 入门 PyTorch入门 PyTorch是深度学习的工业标准框架,动态计算图让调试和实验更直观
- 025 入门 Python环境管理 使用 uv、venv、conda 创建隔离虚拟环境,编写 pyproject.toml 和 lockfile,诊断依赖冲突,实施按阶段的环境策略
- 026 中级 SGLang与RadixAttention前缀密集工作负载 理解SGLang如何通过基数树KV缓存和缓存感知调度实现前缀共享加速
- 027 进阶 TensorRT-LLM与Blackwell FP8/NVFP4 理解Blackwell上TRT-LLM如何通过FP8+NVFP4+MTP实现7x成本优势
- 028 中级 Whisper架构与微调 深入理解Whisper的编码器-解码器架构、分块推理和LoRA微调
- 029 中级 vLLM服务内部:PagedAttention、连续批处理、分块预填充 深入理解vLLM三大核心优化机制及其调度器工作原理
- 030 中级 vLLM生产栈与LMCache KV卸载 理解vLLM生产栈参考部署和LMCache跨引擎KV缓存复用
- 031 中级 不平衡数据处理 不平衡数据中少数类才是重点,重采样和代价敏感学习让模型关注少数类
- 032 进阶 个人AI导师自适应多模态与记忆 Khanmigo (Khan Academy)、Duolingo Max、Google LearnLM/Gemini for Education、Quizlet Q-Chat和Synthesis Tutor都在2026年大规模发布自适应多模态辅导。共同形态:苏格拉底策略(永不直接给答案)、每次交互后更新的学习者模型(贝叶斯知识追踪)、语音+文本+照片数学输入、课程图检索、间隔重复调度、年龄适宜内容的硬安全过滤器。
- 033 入门 什么是机器学习 机器学习是教计算机从数据中发现模式,而不是手工编写规则
- 034 进阶 代码库RAG与跨仓库语义搜索 2026年每个严肃工程组织都运行理解语义的内部代码搜索:tree-sitter解析、函数/类级分块、混合搜索(稠密+BM25)、重排序、带引用的回答。构建处理2M行代码跨10个仓库的系统,在每次git push时存活增量重新索引。
- 035 进阶 代码迁移代理仓库级语言与运行时升级 Amazon MigrationBench (Java 8到17)和Google App Engine Py2到Py3迁移器设定2026年标准。Moderne OpenRewrite做确定性AST重写,Grit用codemod风格DSL。生产模式结合两者:确定性基底处理安全重写+代理层处理模糊情况+沙盒逐分支构建+测试线束在PR打开前翻绿。迁移50个真实仓库并发布通过率和失败分类。
- 036 中级 优化器 优化器决定模型如何更新参数,从SGD到Adam的演进让训练更快更稳定
- 037 中级 优化方法 梯度下降、SGD、动量、Adam、学习率调度、凸优化与非凸优化
- 038 中级 信息论 熵、交叉熵、KL 散度、互信息、困惑度、标签平滑
- 039 中级 偏差方差与学习曲线 偏差方差分解解释了为什么模型会犯错,学习曲线告诉你如何修复
- 040 进阶 傅里叶变换 DFT/FFT 实现、频谱分析、卷积定理、窗函数、STFT、位置编码的联系
- 041 中级 决策树与随机森林 决策树通过一系列是非问题分割数据,随机森林通过组合多棵树来减少过拟合
- 042 进阶 凸优化 凸集与凸函数、Hessian 判断凸性、牛顿法、拉格朗日乘子、KKT 条件、对偶性、正则化与约束优化
- 043 进阶 分离预填充/解码 — NVIDIA Dynamo与llm-d 理解预填充和解码分离如何通过独立伸缩实现30-40%成本节省
- 044 中级 反向传播 反向传播是训练神经网络的核心算法,通过链式法则高效计算梯度
- 045 进阶 反欺骗与音频水印 理解ASVspoof 5、AudioSeal、AASIST等语音反欺骗与水印技术
- 046 入门 合规 — SOC 2、HIPAA、GDPR、PCI-DSS、EU AI Act、ISO 42001 理解2026年多框架合规要求和跨框架映射减少审计疲劳
- 047 中级 向量与矩阵运算 从零实现 Vector 和 Matrix 类,支持元素级运算、矩阵乘法、广播机制,理解形状约定和内存布局
- 048 中级 图论 邻接矩阵、BFS/DFS、图拉普拉斯矩阵、谱聚类、消息传递(GNN)
- 049 进阶 复数 复数运算、欧拉公式、极坐标形式、从单位复数根推导 DFT、RoPE 位置编码的联系
- 050 进阶 多代理软件工程团队 SWE-AF工厂架构、MetaGPT角色提示、AutoGen 0.4类型化actor图、Cognition Devin和Factory Droids都收敛于2026年相同形态:架构师规划、N个编码器并行工作树、审阅者门控、测试者验证。并行工作树将挂钟时间转化为吞吐量。共享状态和交接协议成为失败面。
- 051 中级 多区域LLM服务与KV缓存局部性 理解缓存感知路由如何避免跨区域预填充惩罚和灾难恢复陷阱
- 052 入门 多层网络 多层网络堆叠神经元创建层次化表示,解决单层感知机无法处理的非线性问题
- 053 进阶 多模态文档QA视觉优先PDF与表格与图表 2026年文档QA前沿从OCR-then-text转向视觉优先后期交互。ColPali、ColQwen2.5和ColQwen3-omni将每页PDF视为图像,用多向量后期交互嵌入,让查询直接关注patch。在金融10-K、科学论文和手写笔记上大幅超越OCR优先方案。
- 054 中级 奇异值分解 幂迭代法 SVD、截断 SVD、图像压缩、伪逆、LSA、PCA 与 SVD 的关系
- 055 中级 学习率调度 学习率调度让训练先快后慢,在快速收敛和精细调优之间找到平衡
- 056 入门 安全 — 密钥、API密钥轮换、审计日志与护栏 理解2026年LLM安全最佳实践:集中密钥库、AI网关模式、PII清洗
- 057 进阶 实时语音助手ASR到LLM到TTS 感觉正确的语音代理端到端延迟低于800ms,知道你何时停止说话,处理打断,可以在不卡顿的情况下调用工具。流式ASR、转向检测器、流式LLM和流式TTS通过WebRTC连接。构建一个,测量WER、MOS和误切率,在丢包下运行。
- 058 中级 实时音频处理 理解实时音频的延迟预算、环形缓冲区、VAD门控和中断处理
- 059 进阶 宪法安全线束与红队靶场 Anthropic Constitutional Classifiers、Meta Llama Guard 4、Google ShieldGemma-2、NVIDIA Nemotron 3 Content Safety和X-Guard定义2026年安全分类器栈。garak、PyRIT、NVIDIA Aegis和promptfoo成为标准对抗评估工具。NeMo Guardrails v0.12将它们绑入生产管线。将所有这些连接在一起:围绕目标应用的分层安全线束、运行6+攻击族的自主红队代理、产生可测量无害增量的宪法自我批评运行。
- 060 入门 开发环境搭建 搭建 Python、Node.js、Rust 工具链,配置虚拟环境和包管理器,验证 GPU 访问,理解四层技术栈
- 061 中级 异常检测 异常检测在数据中找到不寻常的模式,从欺诈检测到设备故障预警
- 062 中级 张量运算 Tensor 类实现、步幅与 reshape、广播机制、einsum 表达式、用 einsum 实现注意力机制
- 063 中级 影子流量、金丝雀发布与LLM渐进式部署 理解LLM部署的三阶段策略:影子→金丝雀→A/B测试
- 064 入门 感知机 感知机是最简单的神经网络,一个神经元学会画一条线分割两类数据
- 065 入门 托管LLM平台 — Bedrock、Vertex AI、Azure OpenAI 比较三大超大规模云平台的LLM服务策略、延迟差距和FinOps归属
- 066 入门 批量API — 50%折扣成为行业标准 理解批量API的经济学和三车道工作负载分类法
- 067 进阶 投机解码推理服务器 EAGLE-3在vLLM 0.7中在真实流量上提供2.5-3x吞吐。P-EAGLE (AWS 2026)进一步推进并行推测。SGLang SpecForge大规模训练草稿头。Red Hat Speculators hub发布常见开放模型的对齐草稿。2026年生产服务栈是vLLM或SGLang + EAGLE族草稿 + FP8/INT4量化 + HPA on queue-wait。以2.5x+基线吞吐服务两个开放模型并发布完整尾延迟报告。
- 068 中级 损失函数 损失函数衡量预测与真实值的差距,选择正确的损失函数是训练成功的关键
- 069 入门 推理指标 — TTFT、TPOT、ITL、Goodput、P99 掌握推理服务的核心指标体系,从延迟分解到Goodput复合SLO
- 070 中级 支持向量机 SVM找到最宽的街道来分隔类别,用核技巧处理非线性边界
- 071 入门 推理平台经济学 — Fireworks、Together、Baseten、Modal、Replicate、Anyscale 比较六大推理平台的定价模型、市场定位和成本效益
- 072 中级 数值稳定性 IEEE 754 浮点数、溢出与下溢、log-sum-exp 技巧、稳定 softmax、梯度检查、混合精度、bfloat16
- 073 入门 数据管理 使用 Hugging Face datasets 加载和流式处理数据集,在 CSV/JSON/Parquet/Arrow 格式间转换,创建可复现的数据分割,管理大文件
- 074 中级 文本转语音 从Tacotron到F5和Kokoro,理解现代TTS的三段式架构
- 075 中级 无服务器LLM冷启动缓解 理解五层冷启动缓解策略:预置镜像、模型流式加载、GPU快照、温池和分层加载
- 076 中级 无监督学习 无监督学习在没有标签的数据中发现隐藏结构,包括聚类和降维
- 077 中级 时间序列 时间序列分析处理随时间变化的数据,捕捉趋势、季节性和自相关
- 078 入门 朴素贝叶斯 朴素贝叶斯用条件概率和"朴素"独立性假设实现快速分类
- 079 中级 机器学习微积分 导数、偏导数、梯度、链式法则、Hessian 矩阵、Taylor 级数、积分在机器学习中的应用
- 080 中级 机器学习统计 描述性统计、相关性、假设检验、t 检验、卡方检验、Bootstrap、A/B 测试
- 081 中级 权重初始化 好的权重初始化让训练从正确的起点开始,避免梯度消失和爆炸
- 082 中级 概率与分布 PMF/PDF、常见分布、期望值、中心极限定理、对数概率、softmax、交叉熵
- 083 中级 模型评估 模型评估告诉你模型是否真正有效,而不仅仅是看起来有效
- 084 中级 模型路由作为成本降低原语 理解动态模型级联如何实现20-60%成本降低同时保持质量
- 085 中级 正则化 正则化防止神经网络过拟合,从Dropout到权重衰减的多种策略
- 086 进阶 流式语音对话 理解Moshi、Hibiki的全双工架构和Mimi编解码token上的流式语音对话
- 087 入门 激活函数 激活函数引入非线性,决定了神经元如何将输入转化为输出
- 088 中级 特征工程与选择 特征工程将原始数据转化为模型可用的信号,好的特征胜过好的算法
- 089 中级 特征选择进阶 特征选择移除噪声和冗余特征,让模型更快更准更可解释
- 090 进阶 生产RAG聊天机器人监管垂直领域 Harvey、Glean、Mendable和LlamaCloud在2026年运行相同生产形态:docling/Unstructured + ColPali摄取、混合搜索、bge-reranker-v2-gemma重排序、Claude Sonnet 4.7合成(60-80%提示缓存命中)、Llama Guard 4 + NeMo Guardrails防护、Langfuse/Phoenix监控、RAGAS评估。在监管领域(法律、临床、保险)构建,通过金集、红队和漂移仪表板。
- 091 中级 生产量化 — AWQ、GPTQ、GGUF K-quants、FP8、MXFP4/NVFP4 理解量化格式选择是硬件、服务引擎和工作负载的函数,而非通用选择
- 092 中级 矩阵变换 旋转、缩放、剪切、反射矩阵,特征值与特征向量,特征值分解,对称矩阵的性质
- 093 进阶 神经音频编解码 理解EnCodec、SNAC、Mimi、DAC和语义-声学分离的核心架构
- 094 进阶 端到端微调管线从数据到SFT到DPO到服务 8B模型用自有数据训练、DPO对齐自有偏好、量化、投机解码、以可测量的$/1M tokens服务。2026年开源栈:Axolotl v0.8、TRL 0.15、Unsloth迭代、GPTQ/AWQ/GGUF量化、vLLM 0.7 + EAGLE-3服务。YAML输入,服务端点输出,可重现全管线。
- 095 中级 线性代数直觉 向量、矩阵、点积、线性独立、秩、投影、Gram-Schmidt 正交化的直觉理解与 Python 实现
- 096 入门 线性回归 线性回归通过数据画出最佳拟合直线,是机器学习的"Hello World"
- 097 中级 线性系统 高斯消元、LU/QR/Cholesky 分解、最小二乘、正规方程、条件数、共轭梯度
- 098 入门 终端与Shell 使用管道和 grep 过滤训练日志,创建 tmux 持久会话,监控系统与 GPU 资源,通过 SSH/scp/rsync 传输文件
- 099 进阶 终端原生编码代理 2026年编码代理的架构已定型:TUI线束、有状态计划、沙盒工具面、计划-行动-观察循环。从CLI到Pull Request端到端构建,在SWE-bench Pro上测量。难点不在模型调用而在工具循环、沙盒和成本上限。
- 100 入门 编辑器配置 安装 VS Code 及 Python/Jupyter/Remote SSH 扩展,配置格式化保存和类型检查,设置远程 SSH 开发,评估编辑器替代方案
- 101 进阶 自主研究代理AI-Scientist级 Sakana AI-Scientist-v2发表了完整论文,Agent Laboratory运行实验。2026年形态是计划-执行-验证树搜索:预算成本、沙盒代码执行、视觉反馈LaTeX编写器、自动化NeurIPS风格审稿人集成。构建一个,每篇论文$30内端到端运行,存活Sakana记录的沙盒逃逸红队。
- 102 入门 自托管服务选择 — llama.cpp、Ollama、TGI、vLLM、SGLang 比较2026年五大自托管推理引擎的定位和选择决策树
- 103 中级 范数与距离 L1/L2/Lp 范数、余弦相似度、Mahalanobis 距离、Jaccard 距离、编辑距离、KL 散度、Wasserstein 距离、近似最近邻搜索
- 104 进阶 视频理解管线场景与QA与搜索 Twelve Labs产品化Marengo+Pegasus,VideoDB发布视频CRUD API,AI2 Molmo 2发布开放VLM检查点,Gemini长上下文原生处理小时级视频。2026年管线:场景分割、每场景字幕+嵌入、转录对齐、多向量索引、带(start,end)时间戳+帧预览的查询回答。摄取100小时,命中公开基准,测量计数和动作问题的幻觉。
- 105 进阶 语音克隆与转换 理解零样本克隆、语音转换和水印合规的完整技术栈
- 106 进阶 语音助手流水线 构建端到端语音助手,整合VAD、ASR、LLM、TTS和中断处理
- 107 中级 语音活动检测 理解VAD级联、轮次检测和刷新技巧的完整技术栈
- 108 中级 语音识别ASR 理解CTC、RNN-T和注意力机制三种语音识别范式
- 109 中级 说话人识别与验证 从i-vector到ECAPA-TDNN和WavLM,理解说话人识别的嵌入与评分
- 110 中级 调试与性能分析 使用 breakpoint 和 debug_print 检查张量,使用 cProfile 和 line_profiler 分析性能瓶颈,检测常见 AI Bug,配置 TensorBoard
- 111 进阶 调试神经网络 调试神经网络是系统化的过程,从数据到模型到训练循环逐一排查问题
- 112 中级 贝叶斯定理 贝叶斯定理、朴素贝叶斯分类器、MLE 与 MAP、共轭先验、A/B 测试
- 113 中级 超参数调优 超参数调优找到模型的最佳设置,网格搜索、随机搜索和贝叶斯优化各有优劣
- 114 中级 边缘推理 — Apple Neural Engine、Qualcomm Hexagon、WebGPU、Jetson 理解边缘推理的内存带宽约束和四大平台方案
- 115 进阶 迷你框架 构建一个迷你深度学习框架,整合前向传播、反向传播、优化器和训练循环
- 116 入门 逻辑回归与分类 逻辑回归将直线弯成S曲线,用概率回答是非问题
- 117 进阶 采样方法 逆 CDF 采样、拒绝采样、重要性采样、MCMC、温度/top-k/top-p 采样、重参数化技巧、Gumbel-Softmax
- 118 中级 链式法则与自动微分 链式法则、计算图、前向模式与反向模式自动微分、Value 类实现(micrograd)、从零构建 MLP
- 119 中级 降维 PCA 从零实现、t-SNE、UMAP、核 PCA、解释方差、重建误差
- 120 进阶 随机过程 随机游走、马尔可夫链、布朗运动、Langevin 动力学、MCMC、扩散模型
- 121 中级 集成方法 集成方法组合多个弱学习器创建强学习器,三个臭皮匠顶个诸葛亮
- 122 中级 音乐生成 从MusicGen到Suno,理解音乐生成的Token LM与扩散两条路线
- 123 中级 音频分类 从MFCC上的k-NN到AST和BEATs,理解音频分类的完整技术栈
- 124 中级 音频评估指标 理解WER、MOS、UTMOS、MMAU、FAD、EER等2026年音频评估指标体系
- 125 入门 音频基础 从声波到数字信号,理解音频的物理基础与数字表示
- 126 入门 频谱图与Mel特征 从STFT到Mel频谱图,理解音频AI最核心的特征表示
- 127 进阶 音频语言模型 理解Qwen2.5-Omni、Audio Flamingo等音频语言模型的架构与评估
- 128 入门 机器学习概述 机器学习基本概念、学习范式分类、核心术语与工作流程。
- 129 入门 深度学习概述 深度学习发展历程、核心概念、与机器学习的关系、应用领域。
- 130 入门 神经网络基础 感知机、激活函数、前向传播、损失函数与梯度下降。
- 131 中级 反向传播算法 链式法则、计算图、梯度计算与常见优化器。
- 132 中级 逻辑回归 逻辑回归原理、Sigmoid函数、交叉熵损失、多分类扩展与正则化。
- 133 中级 决策树 决策树算法原理、ID3/C4.5/CART算法对比、信息增益、剪枝策略。
- 134 中级 卷积神经网络 CNN原理、卷积/池化操作、经典架构LeNet/AlexNet/VGG/ResNet详解。
- 135 中级 循环神经网络 RNN原理、LSTM门控机制、GRU、序列建模与应用。
- 136 进阶 Transformer架构 自注意力机制、多头注意力、位置编码与Transformer架构详解。
- 137 中级 K近邻 K近邻算法原理、距离度量、K值选择、KD树加速与优缺点分析。
- 138 进阶 生成模型 GAN、VAE、Diffusion Model生成模型原理与对比。
- 139 进阶 集成学习 集成学习原理、Bagging/Boosting框架、Random Forest/AdaBoost/GBDT/XGBoost/LightGBM详解。
- 140 进阶 预训练模型 BERT、GPT、LLaMA架构、预训练策略与微调技术。
- 141 中级 PyTorch框架 PyTorch核心概念:Tensor、Autograd、nn.Module、训练循环与最佳实践。
- 142 中级 聚类算法 K-Means、DBSCAN、层次聚类原理与对比,聚类评估指标。
- 143 中级 TensorFlow框架 TensorFlow/Keras核心概念、Eager Mode、SavedModel与部署。
- 144 进阶 降维算法 PCA、t-SNE、UMAP降维原理、数学推导与应用场景对比。
- 145 进阶 模型优化与部署 模型量化、剪枝、知识蒸馏、ONNX、TensorRT部署优化。
- 146 中级 模型评估与选择 交叉验证、混淆矩阵、ROC/AUC、偏差方差分解与模型选择策略。
- 147 中级 特征工程详解 特征选择、特征提取、特征构造方法与自动化特征工程。
- 148 进阶 强化学习基础 MDP框架、Q-Learning、DQN、Policy Gradient算法原理与实现。
- 149 中级 Scikit-learn实战 Scikit-learn Pipeline、模型选择、超参调优与最佳实践。