机器学习 知识地图

模块知识结构与学习路径 | 41 篇文档

该模块暂无知识地图

文档索引

Actor-Critic与A2C/A3C 结合策略梯度与价值函数的Actor-Critic架构,A2C与A3C的同步与异步训练
DQN深度Q网络 Q学习与深度神经网络的结合,经验回放与目标网络的核心机制
KNN与距离度量 K近邻算法通过找最近的邻居来分类,距离度量的选择决定了什么是"近"
MDP -- 状态、动作与奖励 马尔可夫决策过程的形式化定义,状态、动作、奖励、转移函数与折扣因子
ML流水线 ML流水线将预处理、训练和预测串联成可复现、可部署的自动化流程
PPO近端策略优化 裁剪策略更新幅度,稳定训练的近端策略优化算法,RLHF的核心训练方法
Q学习与SARSA 时序差分学习与无模型控制,Q学习的离轨策略与SARSA的在轨策略
RL在游戏中的应用 从Atari到星际争霸,强化学习在游戏AI中的里程碑与核心技术
不平衡数据处理 不平衡数据中少数类才是重点,重采样和代价敏感学习让模型关注少数类
仿真到现实迁移 从仿真环境训练到真实世界部署,域随机化与迁移学习的核心技术
什么是机器学习 机器学习是教计算机从数据中发现模式,而不是手工编写规则
偏差方差与学习曲线 偏差方差分解解释了为什么模型会犯错,学习曲线告诉你如何修复
决策树与随机森林 决策树通过一系列是非问题分割数据,随机森林通过组合多棵树来减少过拟合
动态规划 策略评估、策略改进与价值迭代,已知模型下的最优策略求解
多智能体强化学习 多智能体环境中的合作与竞争,从独立学习到通信与协调
奖励建模与RLHF 从人类偏好数据训练奖励模型,RLHF管线与对齐训练的核心技术
异常检测 异常检测在数据中找到不寻常的模式,从欺诈检测到设备故障预警
支持向量机 SVM找到最宽的街道来分隔类别,用核技巧处理非线性边界
时间序列 时间序列分析处理随时间变化的数据,捕捉趋势、季节性和自相关
无监督学习 无监督学习在没有标签的数据中发现隐藏结构,包括聚类和降维
朴素贝叶斯 朴素贝叶斯用条件概率和"朴素"独立性假设实现快速分类
模型评估 模型评估告诉你模型是否真正有效,而不仅仅是看起来有效
特征工程与选择 特征工程将原始数据转化为模型可用的信号,好的特征胜过好的算法
特征选择进阶 特征选择移除噪声和冗余特征,让模型更快更准更可解释
策略梯度与REINFORCE 直接优化策略的梯度方法,REINFORCE算法与基线方差缩减
线性回归 线性回归通过数据画出最佳拟合直线,是机器学习的"Hello World"
超参数调优 超参数调优找到模型的最佳设置,网格搜索、随机搜索和贝叶斯优化各有优劣
蒙特卡洛方法 从经验轨迹中估计价值函数,无需环境模型的蒙特卡洛预测与控制
逻辑回归与分类 逻辑回归将直线弯成S曲线,用概率回答是非问题
集成方法 集成方法组合多个弱学习器创建强学习器,三个臭皮匠顶个诸葛亮
机器学习概述 机器学习基本概念、学习范式分类、核心术语与工作流程。
逻辑回归 逻辑回归原理、Sigmoid函数、交叉熵损失、多分类扩展与正则化。
决策树 决策树算法原理、ID3/C4.5/CART算法对比、信息增益、剪枝策略。
K近邻 K近邻算法原理、距离度量、K值选择、KD树加速与优缺点分析。
集成学习 集成学习原理、Bagging/Boosting框架、Random Forest/AdaBoost/GBDT/XGBoost/LightGBM详解。
聚类算法 K-Means、DBSCAN、层次聚类原理与对比,聚类评估指标。
降维算法 PCA、t-SNE、UMAP降维原理、数学推导与应用场景对比。
模型评估与选择 交叉验证、混淆矩阵、ROC/AUC、偏差方差分解与模型选择策略。
特征工程详解 特征选择、特征提取、特征构造方法与自动化特征工程。
强化学习基础 MDP框架、Q-Learning、DQN、Policy Gradient算法原理与实现。
Scikit-learn实战 Scikit-learn Pipeline、模型选择、超参调优与最佳实践。
专注模式