矩与协方差矩阵

10 minAdvanced2026/6/14

原点矩、中心矩、协方差矩阵的定义与性质、多元正态分布。

1. 矩的概念

1.1 原点矩

XX 为随机变量,kk 为正整数,若 E(Xk)E(X^k) 存在,则称

μk=E(Xk)\mu_k = E(X^k)

XXkk 阶原点矩

特别地,一阶原点矩 μ1=E(X)\mu_1 = E(X) 即为数学期望。

1.2 中心矩

XX 为随机变量,kk 为正整数,若 E[XE(X)]kE[X - E(X)]^k 存在,则称

νk=E[XE(X)]k\nu_k = E[X - E(X)]^k

XXkk 阶中心矩

特别地:

  • 一阶中心矩 ν1=0\nu_1 = 0
  • 二阶中心矩 ν2=D(X)\nu_2 = D(X)(方差)

1.3 原点矩与中心矩的关系

由二项展开:

νk=E[XE(X)]k=j=0k(kj)(1)kjμjμ1kj\nu_k = E[X - E(X)]^k = \sum_{j=0}^{k} \binom{k}{j} (-1)^{k-j} \mu_j \mu_1^{k-j}

常用关系:

ν2=μ2μ12=E(X2)[E(X)]2=D(X)\nu_2 = \mu_2 - \mu_1^2 = E(X^2) - [E(X)]^2 = D(X)

ν3=μ33μ2μ1+2μ13\nu_3 = \mu_3 - 3\mu_2\mu_1 + 2\mu_1^3

ν4=μ44μ3μ1+6μ2μ123μ14\nu_4 = \mu_4 - 4\mu_3\mu_1 + 6\mu_2\mu_1^2 - 3\mu_1^4

1.4 混合矩

X,YX, Y 为随机变量,k,lk, l 为非负整数,若 E(XkYl)E(X^k Y^l) 存在,则称

μk,l=E(XkYl)\mu_{k,l} = E(X^k Y^l)

XXYYk+lk + l 阶混合原点矩

似地,混合中心矩

νk,l=E[XE(X)]k[YE(Y)]l\nu_{k,l} = E[X - E(X)]^k [Y - E(Y)]^l

特别地,ν1,1=Cov(X,Y)\nu_{1,1} = \text{Cov}(X, Y)

2. 偏度与峰度

2.1 偏度

γ1=ν3ν23/2=E[XE(X)]3[D(X)]3/2\gamma_1 = \frac{\nu_3}{\nu_2^{3/2}} = \frac{E[X - E(X)]^3}{[D(X)]^{3/2}}

偏度衡量分布的不对称性

  • γ1>0\gamma_1 > 0:右偏(正偏),分布右侧尾部较长
  • γ1<0\gamma_1 < 0:左偏(负偏),分布左侧尾部较长
  • γ1=0\gamma_1 = 0:对称分布

正态分布的偏度为 0。

2.2 峰度

γ2=ν4ν223=E[XE(X)]4[D(X)]23\gamma_2 = \frac{\nu_4}{\nu_2^2} - 3 = \frac{E[X - E(X)]^4}{[D(X)]^2} - 3

峰度衡量分布的尖峰程度(相对于正态分布):

  • γ2>0\gamma_2 > 0:尖峰分布(比正态分布更尖)
  • γ2<0\gamma_2 < 0:平坦分布(比正态分布更平)
  • γ2=0\gamma_2 = 0:与正态分布相同

正态分布的峰度为 0(因为 ν4ν22=3\dfrac{\nu_4}{\nu_2^2} = 3)。

3. 协方差矩阵

3.1 定义

nn 维随机变量 X=(X1,X2,,Xn)T\mathbf{X} = (X_1, X_2, \cdots, X_n)^T,令

cij=Cov(Xi,Xj)=E[XiE(Xi)][XjE(Xj)],i,j=1,2,,nc_{ij} = \text{Cov}(X_i, X_j) = E[X_i - E(X_i)][X_j - E(X_j)], \quad i, j = 1, 2, \cdots, n

则矩阵

C=(cij)n×n=(c11c12c1nc21c22c2ncn1cn2cnn)\mathbf{C} = (c_{ij})_{n \times n} = \begin{pmatrix} c_{11} & c_{12} & \cdots & c_{1n} \\ c_{21} & c_{22} & \cdots & c_{2n} \\ \vdots & \vdots & \ddots & \vdots \\ c_{n1} & c_{n2} & \cdots & c_{nn} \end{pmatrix}

称为 X\mathbf{X}协方差矩阵

3.2 协方差矩阵的表示

C=E[(Xμ)(Xμ)T]\mathbf{C} = E[(\mathbf{X} - \boldsymbol{\mu})(\mathbf{X} - \boldsymbol{\mu})^T]

其中 μ=E(X)=(E(X1),E(X2),,E(Xn))T\boldsymbol{\mu} = E(\mathbf{X}) = (E(X_1), E(X_2), \cdots, E(X_n))^T

3.3 协方差矩阵的性质

  1. 对称性CT=C\mathbf{C}^T = \mathbf{C}(因为 cij=cjic_{ij} = c_{ji}

  2. 半正定性:对任意 nn 维向量 a\mathbf{a}

aTCa0\mathbf{a}^T \mathbf{C} \mathbf{a} \geq 0

证明

aTCa=aTE[(Xμ)(Xμ)T]a=E[aT(Xμ)(Xμ)Ta]=E[(aT(Xμ))2]0\mathbf{a}^T \mathbf{C} \mathbf{a} = \mathbf{a}^T E[(\mathbf{X} - \boldsymbol{\mu})(\mathbf{X} - \boldsymbol{\mu})^T] \mathbf{a} = E[\mathbf{a}^T(\mathbf{X} - \boldsymbol{\mu})(\mathbf{X} - \boldsymbol{\mu})^T \mathbf{a}] = E[(\mathbf{a}^T(\mathbf{X} - \boldsymbol{\mu}))^2] \geq 0

  1. 对角线元素cii=D(Xi)c_{ii} = D(X_i)

  2. 线性变换:若 Y=AX+b\mathbf{Y} = \mathbf{A}\mathbf{X} + \mathbf{b},则

CY=ACXAT\mathbf{C}_Y = \mathbf{A}\mathbf{C}_X \mathbf{A}^T

4. 相关矩阵

4.1 定义

R=(ρij)n×n\mathbf{R} = (\rho_{ij})_{n \times n}

其中 ρij=cijciicjj\rho_{ij} = \dfrac{c_{ij}}{\sqrt{c_{ii} c_{jj}}}XiX_iXjX_j 的相关系数。

4.2 与协方差矩阵的关系

R=D1/2CD1/2\mathbf{R} = \mathbf{D}^{-1/2} \mathbf{C} \mathbf{D}^{-1/2}

其中 D=diag(c11,c22,,cnn)\mathbf{D} = \text{diag}(c_{11}, c_{22}, \cdots, c_{nn})

5. 多元正态分布

5.1 定义

X=(X1,X2,,Xn)T\mathbf{X} = (X_1, X_2, \cdots, X_n)^T 服从 nn 维正态分布,XNn(μ,Σ)\mathbf{X} \sim N_n(\boldsymbol{\mu}, \boldsymbol{\Sigma}),其密度函数为

f(x)=1(2π)n/2Σ1/2exp{12(xμ)TΣ1(xμ)}f(\mathbf{x}) = \frac{1}{(2\pi)^{n/2} |\boldsymbol{\Sigma}|^{1/2}} \exp\left\{-\frac{1}{2}(\mathbf{x} - \boldsymbol{\mu})^T \boldsymbol{\Sigma}^{-1} (\mathbf{x} - \boldsymbol{\mu})\right\}

其中 μ\boldsymbol{\mu} 为均值向量,Σ\boldsymbol{\Sigma} 为协方差矩阵(正定)。

5.2 多元正态分布的性质

  1. 边缘分布X\mathbf{X} 的任意子向量的边缘分布仍为正态分布

  2. 线性变换:若 Y=AX+b\mathbf{Y} = \mathbf{A}\mathbf{X} + \mathbf{b},则 YN(Aμ+b,AΣAT)\mathbf{Y} \sim N(\mathbf{A}\boldsymbol{\mu} + \mathbf{b}, \mathbf{A}\boldsymbol{\Sigma}\mathbf{A}^T)

  3. 独立与不相关等价XiX_iXjX_j 独立     \iff Cov(Xi,Xj)=0\text{Cov}(X_i, X_j) = 0

  4. 条件分布:给定部分分量的条件下,其余分量的条件分布仍为正态分布

5.3 二元正态分布

μ=(μ1μ2),Σ=(σ12ρσ1σ2ρσ1σ2σ22)\boldsymbol{\mu} = \begin{pmatrix} \mu_1 \\ \mu_2 \end{pmatrix}, \quad \boldsymbol{\Sigma} = \begin{pmatrix} \sigma_1^2 & \rho\sigma_1\sigma_2 \\ \rho\sigma_1\sigma_2 & \sigma_2^2 \end{pmatrix}

Σ=σ12σ22(1ρ2)|\boldsymbol{\Sigma}| = \sigma_1^2\sigma_2^2(1 - \rho^2)