机器学习
监督·无监督·强化学习
- 001 进阶 Actor-Critic与A2C/A3C 结合策略梯度与价值函数的Actor-Critic架构,A2C与A3C的同步与异步训练
- 002 进阶 DQN深度Q网络 Q学习与深度神经网络的结合,经验回放与目标网络的核心机制
- 003 入门 KNN与距离度量 K近邻算法通过找最近的邻居来分类,距离度量的选择决定了什么是"近"
- 004 入门 MDP -- 状态、动作与奖励 马尔可夫决策过程的形式化定义,状态、动作、奖励、转移函数与折扣因子
- 005 中级 ML流水线 ML流水线将预处理、训练和预测串联成可复现、可部署的自动化流程
- 006 进阶 PPO近端策略优化 裁剪策略更新幅度,稳定训练的近端策略优化算法,RLHF的核心训练方法
- 007 中级 Q学习与SARSA 时序差分学习与无模型控制,Q学习的离轨策略与SARSA的在轨策略
- 008 中级 RL在游戏中的应用 从Atari到星际争霸,强化学习在游戏AI中的里程碑与核心技术
- 009 中级 不平衡数据处理 不平衡数据中少数类才是重点,重采样和代价敏感学习让模型关注少数类
- 010 进阶 仿真到现实迁移 从仿真环境训练到真实世界部署,域随机化与迁移学习的核心技术
- 011 入门 什么是机器学习 机器学习是教计算机从数据中发现模式,而不是手工编写规则
- 012 中级 偏差方差与学习曲线 偏差方差分解解释了为什么模型会犯错,学习曲线告诉你如何修复
- 013 中级 决策树与随机森林 决策树通过一系列是非问题分割数据,随机森林通过组合多棵树来减少过拟合
- 014 中级 动态规划 策略评估、策略改进与价值迭代,已知模型下的最优策略求解
- 015 进阶 多智能体强化学习 多智能体环境中的合作与竞争,从独立学习到通信与协调
- 016 进阶 奖励建模与RLHF 从人类偏好数据训练奖励模型,RLHF管线与对齐训练的核心技术
- 017 中级 异常检测 异常检测在数据中找到不寻常的模式,从欺诈检测到设备故障预警
- 018 中级 支持向量机 SVM找到最宽的街道来分隔类别,用核技巧处理非线性边界
- 019 中级 时间序列 时间序列分析处理随时间变化的数据,捕捉趋势、季节性和自相关
- 020 中级 无监督学习 无监督学习在没有标签的数据中发现隐藏结构,包括聚类和降维
- 021 入门 朴素贝叶斯 朴素贝叶斯用条件概率和"朴素"独立性假设实现快速分类
- 022 中级 模型评估 模型评估告诉你模型是否真正有效,而不仅仅是看起来有效
- 023 中级 特征工程与选择 特征工程将原始数据转化为模型可用的信号,好的特征胜过好的算法
- 024 中级 特征选择进阶 特征选择移除噪声和冗余特征,让模型更快更准更可解释
- 025 进阶 策略梯度与REINFORCE 直接优化策略的梯度方法,REINFORCE算法与基线方差缩减
- 026 入门 线性回归 线性回归通过数据画出最佳拟合直线,是机器学习的"Hello World"
- 027 中级 超参数调优 超参数调优找到模型的最佳设置,网格搜索、随机搜索和贝叶斯优化各有优劣
- 028 中级 蒙特卡洛方法 从经验轨迹中估计价值函数,无需环境模型的蒙特卡洛预测与控制
- 029 入门 逻辑回归与分类 逻辑回归将直线弯成S曲线,用概率回答是非问题
- 030 中级 集成方法 集成方法组合多个弱学习器创建强学习器,三个臭皮匠顶个诸葛亮
- 031 入门 机器学习概述 机器学习基本概念、学习范式分类、核心术语与工作流程。
- 032 中级 逻辑回归 逻辑回归原理、Sigmoid函数、交叉熵损失、多分类扩展与正则化。
- 033 中级 决策树 决策树算法原理、ID3/C4.5/CART算法对比、信息增益、剪枝策略。
- 034 中级 K近邻 K近邻算法原理、距离度量、K值选择、KD树加速与优缺点分析。
- 035 进阶 集成学习 集成学习原理、Bagging/Boosting框架、Random Forest/AdaBoost/GBDT/XGBoost/LightGBM详解。
- 036 中级 聚类算法 K-Means、DBSCAN、层次聚类原理与对比,聚类评估指标。
- 037 进阶 降维算法 PCA、t-SNE、UMAP降维原理、数学推导与应用场景对比。
- 038 中级 模型评估与选择 交叉验证、混淆矩阵、ROC/AUC、偏差方差分解与模型选择策略。
- 039 中级 特征工程详解 特征选择、特征提取、特征构造方法与自动化特征工程。
- 040 进阶 强化学习基础 MDP框架、Q-Learning、DQN、Policy Gradient算法原理与实现。
- 041 中级 Scikit-learn实战 Scikit-learn Pipeline、模型选择、超参调优与最佳实践。