设 θ^ 是参数 θ 的估计量,若对一切 θ∈Θ,有
E(θ^)=θ
则称 θ^ 是 θ 的无偏估计量(或无偏估计)。
若 E(θ^)=θ,则称 θ^ 是 θ 的有偏估计,E(θ^)−θ 称为偏差。
若 limn→∞E(θ^n)=θ,则称 θ^n 是 θ 的渐近无偏估计。
样本均值:E(Xˉ)=μ,Xˉ 是 μ 的无偏估计。
样本方差:E(S2)=σ2,S2 是 σ2 的无偏估计。
二阶中心矩:E(B2)=E(n1∑(Xi−Xˉ)2)=nn−1σ2,B2 不是 σ2 的无偏估计,但渐近无偏。
无偏性意味着估计量在大量重复使用时,平均来说没有系统偏差。
同一个参数可以有无穷多个无偏估计。例如,Xˉ 是 μ 的无偏估计,X1 也是 μ 的无偏估计。
设 θ^1 和 θ^2 都是 θ 的无偏估计,若对一切 θ∈Θ,有
D(θ^1)≤D(θ^2)
且至少存在一个 θ 使不等号严格成立,则称 θ^1 比 θ^2 有效。
若 θ^∗ 是 θ 的无偏估计,且对 θ 的任何无偏估计 θ^,都有
D(θ^∗)≤D(θ^)
则称 θ^∗ 为 θ 的最小方差无偏估计(MVUE)。
设总体 X 的密度函数为 f(x;θ),满足一定正则条件,则 θ 的任何无偏估计 θ^ 的方差满足
D(θ^)≥nI(θ)1
其中
I(θ)=E[(∂θ∂lnf(X;θ))2]=−E[∂θ2∂2lnf(X;θ)]
称为 Fisher 信息量。
若某个无偏估计的方差达到 C-R 下界,则它一定是 MVUE。
例题:设 X1,⋯,Xn∼N(μ,σ2),比较 Xˉ 和 X1 作为 μ 的估计的有效性。
解:两者都是 μ 的无偏估计。
D(Xˉ)=nσ2,D(X1)=σ2
当 n>1 时,D(Xˉ)<D(X1),故 Xˉ 比 X1 有效。
设 θ^n 是参数 θ 的估计量,若对任意 ε>0,
limn→∞P(∣θ^n−θ∣<ε)=1
即 θ^nPθ,则称 θ^n 是 θ 的一致估计(或相合估计)。
定理:若 θ^n 是 θ 的渐近无偏估计,且 limn→∞D(θ^n)=0,则 θ^n 是 θ 的一致估计。
证明:由切比雪夫不等式,P(∣θ^n−E(θ^n)∣≥ε)≤ε2D(θ^n)→0。
再由 E(θ^n)→θ,可得 θ^nPθ。
- Xˉ 是 μ 的一致估计(由大数定律)
- S2 是 σ2 的一致估计
- Ak 是 μk 的一致估计
一致性是最基本的要求:当样本量增大时,估计量应越来越接近真实参数。如果一个估计量不是一致的,则增大样本量也不能改善估计精度。
- 一致性是最基本的要求(大样本性质)
- 无偏性是中等要求(消除系统偏差)
- 有效性是更高要求(在无偏估计中选最优)
| 标准 | 性质 | 样本量要求 |
|---|
| 无偏性 | 期望等于真值 | 有限样本 |
| 有效性 | 方差最小 | 有限样本 |
| 一致性 | 依概率收敛 | 大样本 |
MSE(θ^)=E(θ^−θ)2=D(θ^)+[E(θ^)−θ]2=D(θ^)+偏差2
MSE 综合考虑了偏差和方差,是评价估计量的更全面指标。有时一个有偏估计的 MSE 可能比无偏估计更小(偏差-方差权衡)。