机器学习概述
机器学习基本概念、学习范式分类、核心术语与工作流程。
1. 机器学习基本概念
机器学习(Machine Learning)是人工智能的核心分支,通过从数据中自动学习规律,使计算机无需显式编程即可完成特定任务。
1.1 形式化定义
给定训练数据集 ,机器学习的目标是从假设空间 中寻找最优函数 ,使得期望风险最小化:
其中 为损失函数, 为数据分布。由于真实分布未知,我们用经验风险近似:
1.2 核心术语
| 术语 | 符号 | 说明 |
|---|---|---|
| 特征(Feature) | 输入变量, | |
| 标签(Label) | 输出变量(监督学习) | |
| 样本(Sample) | 一条训练数据 | |
| 假设(Hypothesis) | 学习到的映射函数 | |
| 损失函数 | 单个预测的误差度量 | |
| 代价函数 | 所有样本的平均损失 | |
| 参数 | 模型需要学习的量 | |
| 超参数 | — | 需要人为设定的量 |
2. 学习范式分类
2.1 监督学习(Supervised Learning)
从带标签的数据中学习输入到输出的映射:
| 子类型 | 输出类型 | 典型算法 | 应用 |
|---|---|---|---|
| 分类 | 离散值 | SVM、决策树、逻辑回归 | 垃圾邮件识别 |
| 回归 | 连续值 | 线性回归、随机森林 | 房价预测 |
2.2 无监督学习(Unsupervised Learning)
从无标签的数据中发现隐含结构:
| 子类型 | 目标 | 典型算法 | 应用 |
|---|---|---|---|
| 聚类 | 分组 | K-Means、DBSCAN | 客户分群 |
| 降维 | 压缩 | PCA、t-SNE | 数据可视化 |
| 关联规则 | 发现关系 | Apriori | 购物篮分析 |
| 生成模型 | 学习分布 | GMM、VAE | 数据生成 |
2.3 半监督学习(Semi-Supervised Learning)
利用少量有标签数据和大量无标签数据:
有标签数据: 100条 (标注成本高)
无标签数据: 10000条 (容易获取)
策略:
1. 自训练(Self-Training):用有标签数据训练,预测无标签数据,高置信度加入训练集
2. 协同训练(Co-Training):两个分类器互相标注
3. 图方法:基于数据相似度构建图,标签在图上传播
2.4 强化学习(Reinforcement Learning)
智能体通过与环境交互获得奖励来学习最优策略:
| 要素 | 说明 |
|---|---|
| 状态 | 环境的当前描述 |
| 动作 | 智能体的行为 |
| 奖励 | 环境的反馈信号 |
| 策略 | 状态到动作的映射 |
| 折扣因子 | 未来奖励的衰减系数 |
3. 机器学习工作流程
3.1 完整流程
业务理解 → 数据收集 → 数据预处理 → 特征工程 → 模型选择 → 模型训练 → 模型评估 → 模型部署
│ │ │ │ │ │ │ │
▼ ▼ ▼ ▼ ▼ ▼ ▼ ▼
定义目标 获取数据 清洗/转换 选择/构造 算法选择 参数学习 性能度量 在线/离线
多源融合 缺失值处理 特征选择 超参设定 正则化 交叉验证 A/B测试
3.2 数据预处理
| 步骤 | 方法 | 说明 |
|---|---|---|
| 缺失值处理 | 均值/中位数/众数填充、删除 | 保证数据完整性 |
| 异常值检测 | 3σ原则、IQR方法 | 避免极端值干扰 |
| 数据标准化 | Z-Score: | 消除量纲影响 |
| 数据归一化 | Min-Max: | 映射到[0,1] |
| 编码 | One-Hot、Label Encoding | 处理类别变量 |
3.3 数据集划分
- 训练集:用于模型学习参数
- 验证集:用于超参数调优和模型选择
- 测试集:用于最终性能评估(只用一次)
交叉验证:K折交叉验证将数据分为K份,轮流作为验证集:
4. 偏差-方差权衡
4.1 误差分解
模型的泛化误差可分解为:
| 组成 | 定义 | 说明 |
|---|---|---|
| 偏差(Bias) | 预测值与真实值的偏离 | 模型拟合能力不足(欠拟合) |
| 方差(Variance) | 预测值随训练集变化的波动 | 模型对数据过于敏感(过拟合) |
| 噪声(Noise) | 数据本身的误差 | 不可约减的误差 |
4.2 欠拟合与过拟合
| 问题 | 表现 | 原因 | 解决方案 |
|---|---|---|---|
| 欠拟合 | 训练集和测试集误差都高 | 模型太简单 | 增加特征、使用更复杂模型 |
| 过拟合 | 训练集误差低、测试集误差高 | 模型太复杂 | 正则化、增加数据、早停 |
4.3 正则化
通过在代价函数中添加惩罚项来限制模型复杂度:
L1正则化(Lasso):
- 产生稀疏解,可用于特征选择
- 使部分参数恰好为零
L2正则化(Ridge):
- 使参数趋向较小的值
- 防止某个参数过大
弹性网络(Elastic Net):
5. 机器学习发展历程
1950s ── 感知机(Rosenblatt)
│
1960s ── 线性判别分析、K近邻
│
1970s ── AI寒冬(感知机局限性暴露)
│
1980s ── 决策树(ID3)、BP算法
│
1990s ── SVM、随机森林、Boosting
│
2000s ── 集成学习、图模型
│
2010s ── 深度学习爆发(CNN、RNN、GAN)
│
2020s ── 大模型时代(Transformer、GPT、LLaMA)