| 阶段 | 年代 | 核心思想 |
|---|
| 符号主义 | 1950s-1980s | 基于逻辑推理 |
| 连接主义 | 1980s-1990s | 神经网络 |
| 统计学习 | 2000s-2010s | 机器学习 |
| 深度学习 | 2012- | 深层神经网络 |
| 大模型 | 2020- | Transformer、LLM |
| 类型 | 定义 | 示例 |
|---|
| 弱AI | 特定任务 | 图像识别、语音助手 |
| 强AI | 通用智能 | 尚未实现 |
| 超级AI | 超越人类 | 理论概念 |
| 算法 | 完备性 | 最优性 | 时间 | 空间 |
|---|
| BFS | 是 | 是(等代价) | O(bd) | O(bd) |
| DFS | 否 | 否 | O(bm) | O(bm) |
| UCS | 是 | 是 | O(bC∗/ϵ) | O(bC∗/ϵ) |
| IDS | 是 | 是(等代价) | O(bd) | O(bd) |
b:分支因子,d:解深度,m:最大深度
A* 算法:
f(n)=g(n)+h(n)
- g(n):从起点到 n 的实际代价
- h(n):从 n 到目标的启发式估计
最优性条件:h(n) 是可采纳的(不高估实际代价)。
A* 的效率:
有效分支因子=b∗:N=1+b∗+(b∗)2+...
Minimax 算法:
V(s)=⎩⎨⎧utility(s)maxaV(result(s,a))minaV(result(s,a))终止状态MAX 节点MIN 节点
Alpha-Beta 剪枝:
- α:MAX 节点当前最优值
- β:MIN 节点当前最优值
- 剪枝条件:α≥β
最佳情况下搜索节点数:O(bd/2)
基本元素:
- 常量:John, 5
- 变量:x, y
- 谓词:Likes(x,y)
- 函数:Father(John)
- 量词:∀, ∃
推理规则:
- 假言推理(Modus Ponens):P,P→Q⊢Q
- 全称实例化:∀xP(x)⊢P(a)
- 存在实例化:∃xP(x)⊢P(c)
用图结构表示概念间的关系:
[鸟] --is-a--> [动物]
[企鹅] --is-a--> [鸟]
[企鹅] --cannot--> [飞]
使用 OWL(Web Ontology Language)定义概念层次和关系:
- 类(Class)
- 属性(Property)
- 个体(Individual)
- 公理(Axiom)
| 范式 | 训练数据 | 目标 |
|---|
| 监督学习 | 标注数据 | 预测标签 |
| 无监督学习 | 无标注数据 | 发现结构 |
| 半监督学习 | 部分+大量无标注 | 预测标签 |
| 强化学习 | 环境反馈 | 最大化奖励 |
| 自监督学习 | 自生成标签 | 学习表示 |
y^=wTx+b
损失函数(MSE):
L=n1∑i=1n(yi−y^i)2
正规方程:
w∗=(XTX)−1XTy
P(y=1∣x)=σ(wTx+b)=1+e−(wTx+b)1
交叉熵损失:
L=−n1∑i=1n[yilogy^i+(1−yi)log(1−y^i)]
最大间隔:
maxw,b∥w∥2s.t.yi(wTxi+b)≥1
核技巧:
K(xi,xj)=ϕ(xi)Tϕ(xj)
常用核函数:
| 核函数 | 公式 |
|---|
| 线性核 | K=xiTxj |
| 多项式核 | K=(xiTxj+c)d |
| RBF核 | K=e−γ∥xi−xj∥2 |
| 指标 | 公式 |
|---|
| 准确率 | TP+TN+FP+FNTP+TN |
| 精确率 | TP+FPTP |
| 召回率 | TP+FNTP |
| F1 | 2×P+RP×R |
| AUC-ROC | ROC曲线下面积 |
偏差-方差权衡:
泛化误差=偏差2+方差+噪声
h=σ(W1x+b1)
y=W2h+b2
反向传播:
∂W∂L=∂y∂L⋅∂h∂y⋅∂W∂h
| 函数 | 公式 | 特点 |
|---|
| ReLU | max(0,x) | 计算快,有死亡问题 |
| Leaky ReLU | max(αx,x) | 缓解死亡 |
| GELU | xΦ(x) | Transformer 常用 |
| Swish | xσ(βx) | 平滑 |
| 算法 | 更新规则 |
|---|
| SGD | θ=θ−η∇L |
| Momentum | v=βv+∇L,θ=θ−ηv |
| Adam | 结合 Momentum 和 RMSProp |
Adam 更新规则:
mt=β1mt−1+(1−β1)gt
vt=β2vt−1+(1−β2)gt2
θt=θt−1−v^t+ϵηm^t
| 技术 | 方法 | 防止 |
|---|
| Dropout | 随机丢弃神经元 | 过拟合 |
| L2 正则 | λ∥w∥2 | 过拟合 |
| Batch Norm | 归一化层输入 | 内部协变量偏移 |
| 数据增强 | 扩充训练数据 | 过拟合 |
| 早停 | 验证集性能下降时停止 | 过拟合 |
核心操作:
- 卷积:提取局部特征
- 池化:降维,增强平移不变性
- 全连接:分类决策
经典架构:
| 网络 | 年份 | 创新 |
|---|
| LeNet | 1998 | 开创性 CNN |
| AlexNet | 2012 | ReLU、Dropout |
| VGG | 2014 | 小卷积核堆叠 |
| ResNet | 2015 | 残差连接 |
| EfficientNet | 2019 | 复合缩放 |
残差连接:
y=F(x)+x
解决深层网络的梯度消失问题。
自注意力机制:
Attention(Q,K,V)=softmax(dkQKT)V
多头注意力:
MultiHead(Q,K,V)=Concat(head1,...,headh)WO
headi=Attention(QWiQ,KWiK,VWiV)
基于 Transformer Decoder 的生成式模型:
- GPT 系列:自回归生成
- BERT:双向编码
- LLaMA:开源大模型
缩放定律:
L(N)≈(NNc)α
模型性能随参数量 N、数据量 D、计算量 C 的增加而可预测地提升。