机器学习
监督·无监督·强化学习
- 001进阶Actor-Critic与A2C/A3C结合策略梯度与价值函数的Actor-Critic架构,A2C与A3C的同步与异步训练
- 002进阶DQN深度Q网络Q学习与深度神经网络的结合,经验回放与目标网络的核心机制
- 003入门KNN与距离度量K近邻算法通过找最近的邻居来分类,距离度量的选择决定了什么是"近"
- 004入门MDP -- 状态、动作与奖励马尔可夫决策过程的形式化定义,状态、动作、奖励、转移函数与折扣因子
- 005中级ML流水线ML流水线将预处理、训练和预测串联成可复现、可部署的自动化流程
- 006进阶PPO近端策略优化裁剪策略更新幅度,稳定训练的近端策略优化算法,RLHF的核心训练方法
- 007中级Q学习与SARSA时序差分学习与无模型控制,Q学习的离轨策略与SARSA的在轨策略
- 008中级RL在游戏中的应用从Atari到星际争霸,强化学习在游戏AI中的里程碑与核心技术
- 009中级不平衡数据处理不平衡数据中少数类才是重点,重采样和代价敏感学习让模型关注少数类
- 010入门什么是机器学习机器学习是教计算机从数据中发现模式,而不是手工编写规则
- 011进阶仿真到现实迁移从仿真环境训练到真实世界部署,域随机化与迁移学习的核心技术
- 012中级偏差方差与学习曲线偏差方差分解解释了为什么模型会犯错,学习曲线告诉你如何修复
- 013中级决策树与随机森林决策树通过一系列是非问题分割数据,随机森林通过组合多棵树来减少过拟合
- 014中级动态规划策略评估、策略改进与价值迭代,已知模型下的最优策略求解
- 015进阶多智能体强化学习多智能体环境中的合作与竞争,从独立学习到通信与协调
- 016进阶奖励建模与RLHF从人类偏好数据训练奖励模型,RLHF管线与对齐训练的核心技术
- 017中级异常检测异常检测在数据中找到不寻常的模式,从欺诈检测到设备故障预警
- 018中级支持向量机SVM找到最宽的街道来分隔类别,用核技巧处理非线性边界
- 019中级无监督学习无监督学习在没有标签的数据中发现隐藏结构,包括聚类和降维
- 020中级时间序列时间序列分析处理随时间变化的数据,捕捉趋势、季节性和自相关
- 021入门朴素贝叶斯朴素贝叶斯用条件概率和"朴素"独立性假设实现快速分类
- 022中级模型评估模型评估告诉你模型是否真正有效,而不仅仅是看起来有效
- 023中级特征工程与选择特征工程将原始数据转化为模型可用的信号,好的特征胜过好的算法
- 024中级特征选择进阶特征选择移除噪声和冗余特征,让模型更快更准更可解释
- 025进阶策略梯度与REINFORCE直接优化策略的梯度方法,REINFORCE算法与基线方差缩减
- 026入门线性回归线性回归通过数据画出最佳拟合直线,是机器学习的"Hello World"
- 027中级蒙特卡洛方法从经验轨迹中估计价值函数,无需环境模型的蒙特卡洛预测与控制
- 028中级超参数调优超参数调优找到模型的最佳设置,网格搜索、随机搜索和贝叶斯优化各有优劣
- 029入门逻辑回归与分类逻辑回归将直线弯成S曲线,用概率回答是非问题
- 030中级集成方法集成方法组合多个弱学习器创建强学习器,三个臭皮匠顶个诸葛亮
- 031入门机器学习概述机器学习基本概念、学习范式分类、核心术语与工作流程。
- 032中级逻辑回归逻辑回归原理、Sigmoid函数、交叉熵损失、多分类扩展与正则化。
- 033中级决策树决策树算法原理、ID3/C4.5/CART算法对比、信息增益、剪枝策略。
- 034中级K近邻K近邻算法原理、距离度量、K值选择、KD树加速与优缺点分析。
- 035进阶集成学习集成学习原理、Bagging/Boosting框架、Random Forest/AdaBoost/GBDT/XGBoost/LightGBM详解。
- 036中级聚类算法K-Means、DBSCAN、层次聚类原理与对比,聚类评估指标。
- 037进阶降维算法PCA、t-SNE、UMAP降维原理、数学推导与应用场景对比。
- 038中级模型评估与选择交叉验证、混淆矩阵、ROC/AUC、偏差方差分解与模型选择策略。
- 039中级特征工程详解特征选择、特征提取、特征构造方法与自动化特征工程。
- 040进阶强化学习基础MDP框架、Q-Learning、DQN、Policy Gradient算法原理与实现。
- 041中级Scikit-learn实战Scikit-learn Pipeline、模型选择、超参调优与最佳实践。