机器学习概述

00:00
8 min Beginner 2026/6/15

机器学习基本概念、学习范式分类、核心术语与工作流程。

1. 机器学习基本概念

机器学习(Machine Learning)是人工智能的核心分支,通过从数据中自动学习规律,使计算机无需显式编程即可完成特定任务。

1.1 形式化定义

给定训练数据集 ,机器学习的目标是从假设空间 中寻找最优函数 ,使得期望风险最小化:

其中 为损失函数, 为数据分布。由于真实分布未知,我们用经验风险近似:

1.2 核心术语

术语符号说明
特征(Feature)输入变量,
标签(Label)输出变量(监督学习)
样本(Sample)一条训练数据
假设(Hypothesis)学习到的映射函数
损失函数单个预测的误差度量
代价函数所有样本的平均损失
参数模型需要学习的量
超参数需要人为设定的量

2. 学习范式分类

2.1 监督学习(Supervised Learning)

带标签的数据中学习输入到输出的映射:

子类型输出类型典型算法应用
分类离散值SVM、决策树、逻辑回归垃圾邮件识别
回归连续值线性回归、随机森林房价预测

2.2 无监督学习(Unsupervised Learning)

无标签的数据中发现隐含结构:

子类型目标典型算法应用
聚类分组K-Means、DBSCAN客户分群
降维压缩PCA、t-SNE数据可视化
关联规则发现关系Apriori购物篮分析
生成模型学习分布GMM、VAE数据生成

2.3 半监督学习(Semi-Supervised Learning)

利用少量有标签数据和大量无标签数据:

有标签数据: 100条 (标注成本高)
无标签数据: 10000条 (容易获取)

策略:
  1. 自训练(Self-Training):用有标签数据训练,预测无标签数据,高置信度加入训练集
  2. 协同训练(Co-Training):两个分类器互相标注
  3. 图方法:基于数据相似度构建图,标签在图上传播

2.4 强化学习(Reinforcement Learning)

智能体通过与环境交互获得奖励来学习最优策略:

要素说明
状态 环境的当前描述
动作 智能体的行为
奖励 环境的反馈信号
策略 状态到动作的映射
折扣因子 未来奖励的衰减系数

3. 机器学习工作流程

3.1 完整流程

3.2 数据预处理

步骤方法说明
缺失值处理均值/中位数/众数填充、删除保证数据完整性
异常值检测3σ原则、IQR方法避免极端值干扰
数据标准化Z-Score:消除量纲影响
数据归一化Min-Max:映射到[0,1]
编码One-Hot、Label Encoding处理类别变量

3.3 数据集划分

  • 训练:用于模型学习参数
  • 验证:用于超参数调优和模型选择
  • 测试:用于最终性能评估(只用一次)

交叉验证:K折交叉验证将数据分为K份,流作为验证集:

4. 偏差-方差权衡

4.1 误差分解

模型的泛化误差可分解为:

组成定义说明
偏差(Bias)预测值与真实值的偏离模型拟合能力不足(欠拟合)
方差Variance预测值随训练变化的波动模型数据过于敏感(过拟合)
噪声(Noise)数据本身的误差不可约减的误差

4.2 欠拟合与过拟合

问题原因解决方案
欠拟合训练集和测试集误差都模型太简单增加特征、使用更复杂模型
过拟合训练集误差低、测试集误差模型太复杂正则化、增加数据、早停

4.3 正则化

通过在代价函数中添加惩罚项来限制模型复杂

L1正则化(Lasso)

  • 产生稀疏,可用于特征选择
  • 使部分参数恰好为零

L2正则化(Ridge)

  • 使参数趋向较小的
  • 防止某个参数过大

弹性网络(Elastic Net)

5. 机器学习发展历程

知识检测

学习进度

-- 已学文档
--% 知识覆盖率

学习推荐

专注模式