人工智能基础
00:00
人工智能基础:搜索算法、知识表示、机器学习、神经网络与深度学习
1. 人工智能概述
1.1 AI 发展历程
| 阶段 | 年代 | 核心思想 |
|---|---|---|
| 符号主义 | 1950s-1980s | 基于逻辑推理 |
| 连接主义 | 1980s-1990s | 神经网络 |
| 统计学习 | 2000s-2010s | 机器学习 |
| 深度学习 | 2012- | 深层神经网络 |
| 大模型 | 2020- | Transformer、LLM |
1.2 AI 分类
| 类型 | 定义 | 示例 |
|---|---|---|
| 弱AI | 特定任务 | 图像识别、语音助手 |
| 强AI | 通用智能 | 尚未实现 |
| 超级AI | 超越人类 | 理论概念 |
2. 搜索算法
2.1 无信息搜索
| 算法 | 完备性 | 最优性 | 时间 | 空间 |
|---|---|---|---|---|
| BFS | 是 | 是(等代价) | ||
| DFS | 否 | 否 | ||
| UCS | 是 | 是 | ||
| IDS | 是 | 是(等代价) |
:分支因子,:解深度,:最大深度
2.2 启发式搜索
A* 算法:
- :从起点到 的实际代价
- :从 到目标的启发式估计
最优性条件: 是可采纳的(不高估实际代价)。
A* 的效率:
2.3 对抗搜索
Minimax 算法:
Alpha-Beta 剪枝:
- :MAX 节点当前最优值
- :MIN 节点当前最优值
- 剪枝条件:
最佳情况下搜索节点数:
3. 知识表示与推理
3.1 一阶谓词逻辑
基本元素:
- 常量:John, 5
- 变量:,
- 谓词:
- 函数:
- 量词:,
推理规则:
- 假言推理(Modus Ponens):
- 全称实例化:
- 存在实例化:
3.2 语义网络
用图结构表示概念间的关系:
[鸟] --is-a--> [动物]
[企鹅] --is-a--> [鸟]
[企鹅] --cannot--> [飞]
3.3 本体论
使用 OWL(Web Ontology Language)定义概念层次和关系:
- 类(Class)
- 属性(Property)
- 个体(Individual)
- 公理(Axiom)
4. 机器学习
4.1 学习范式
| 范式 | 训练数据 | 目标 |
|---|---|---|
| 监督学习 | 标注数据 | 预测标签 |
| 无监督学习 | 无标注数据 | 发现结构 |
| 半监督学习 | 部分+大量无标注 | 预测标签 |
| 强化学习 | 环境反馈 | 最大化奖励 |
| 自监督学习 | 自生成标签 | 学习表示 |
4.2 线性回归
损失函数(MSE):
正规方程:
4.3 逻辑回归
交叉熵损失:
4.4 支持向量机(SVM)
最大间隔:
核技巧:
常用核函数:
| 核函数 | 公式 |
|---|---|
| 线性核 | |
| 多项式核 | |
| RBF核 |
4.5 模型评估
| 指标 | 公式 |
|---|---|
| 准确率 | |
| 精确率 | |
| 召回率 | |
| F1 | |
| AUC-ROC | ROC曲线下面积 |
偏差-方差权衡:
5. 神经网络
5.1 多层感知机(MLP)
反向传播:
5.2 常用激活函数
| 函数 | 公式 | 特点 |
|---|---|---|
| ReLU | 计算快,有死亡问题 | |
| Leaky ReLU | 缓解死亡 | |
| GELU | Transformer 常用 | |
| Swish | 平滑 |
5.3 优化算法
| 算法 | 更新规则 |
|---|---|
| SGD | |
| Momentum | |
| Adam | 结合 Momentum 和 RMSProp |
Adam 更新规则:
5.4 正则化技术
| 技术 | 方法 | 防止 |
|---|---|---|
| Dropout | 随机丢弃神经元 | 过拟合 |
| L2 正则 | 过拟合 | |
| Batch Norm | 归一化层输入 | 内部协变量偏移 |
| 数据增强 | 扩充训练数据 | 过拟合 |
| 早停 | 验证集性能下降时停止 | 过拟合 |
6. 深度学习
6.1 CNN(卷积神经网络)
核心操作:
- 卷积:提取局部特征
- 池化:降维,增强平移不变性
- 全连接:分类决策
经典架构:
| 网络 | 年份 | 创新 |
|---|---|---|
| LeNet | 1998 | 开创性 CNN |
| AlexNet | 2012 | ReLU、Dropout |
| VGG | 2014 | 小卷积核堆叠 |
| ResNet | 2015 | 残差连接 |
| EfficientNet | 2019 | 复合缩放 |
残差连接:
解决深层网络的梯度消失问题。
6.2 Transformer
自注意力机制:
多头注意力:
6.3 大语言模型(LLM)
基于 Transformer Decoder 的生成式模型:
- GPT 系列:自回归生成
- BERT:双向编码
- LLaMA:开源大模型
缩放定律:
模型性能随参数量 、数据量 、计算量 的增加而可预测地提升。