← 返回《数据科学的统计基础》
📑 查看全课大纲(第 10 / 41 节)

无偏估计与一致最小方差无偏估计(一)

约 52 分钟

📺 正在播放小象官方高清录播(支持倍速与清晰度调节)

无偏估计与一致最小方差无偏估计(一)

小象实战讲义 · 数据科学的统计基础

在前两节中,我们学习了矩估计和极大似然估计两种构造估计量的方法。然而,我们很快发现,对于同一个总体参数,其估计量往往不唯一。例如,泊松分布的参数 λ\lambda 既可以用样本均值估计,也可以用样本方差估计。那么,当面对多个可能的估计量时,我们该如何评判孰优孰劣呢?本节将引入评价估计量优良性的核心准则——无偏性,并探讨如何在无偏估计类中寻找“最优”的估计,即一致最小方差无偏估计(UMVUE)。学完本节,你将能够理解无偏性的含义与局限,掌握比较估计量有效性的方法,并为后续学习寻找UMVUE的理论工具奠定基础。

💡 核心导读

  • 为何需要评价准则:估计量的不唯一性(源于估计方法不同或同种方法下估计量不同)引出了对估计量进行优劣比较的必要性。
  • 无偏性:估计量优良性的基本准则之一,指估计量的期望等于待估参数的真实值,意味着没有系统性偏差。
  • 有效性:在无偏估计类中,方差越小的估计量越有效,意味着其估计结果更稳定、更集中。
  • 均方误差(MSE)准则:一个更综合的评价标准,同时考虑了估计量的偏差和方差。在无偏估计类中,MSE最小等价于方差最小。
  • UMVUE的概念:在无偏估计类中,方差达到最小的那个估计量,称为一致最小方差无偏估计,是我们在无偏性约束下追求的“最优”估计目标。

从估计量的不唯一性到评价准则

在矩估计和极大似然估计的学习中,我们已经观察到估计量的不唯一性。这种不唯一性体现在两个层面:

  1. 估计方法的不唯一:对同一参数 θ\theta,我们可以使用矩估计法,也可以使用极大似然估计法,得到不同的估计量 θ^M\hat{\theta}Mθ^ML\hat{\theta}{ML}
  2. 同种方法下估计量的不唯一:即使使用同一种估计方法,也可能得到多个不同的估计量。
    • 矩估计例子:设 X1,,Xni.i.d.P(λ)X_1, \ldots, X_n \stackrel{\text{i.i.d.}}{\sim} P(\lambda),即来自参数为 λ\lambda 的泊松分布。我们知道 E(X)=λE(X) = \lambdaVar(X)=λVar(X) = \lambda。根据矩估计的替换原理:
      • 用一阶原点矩(期望)估计:λ^1=Xˉ=1ni=1nXi\hat{\lambda}1 = \bar{X} = \frac{1}{n}\sum{i=1}^n X_i
      • 用二阶中心矩(方差)估计:λ^2=Sn2=1ni=1n(XiXˉ)2\hat{\lambda}2 = S_n^2 = \frac{1}{n}\sum{i=1}^n (X_i - \bar{X})^2。 两者都是 λ\lambda 的矩估计,但通常我们遵循“能用低阶矩不用高阶矩”的原则,优先使用 λ^1\hat{\lambda}_1
    • 极大似然估计例子:设 X1,,Xni.i.d.U(θ,θ+1)X_1, \ldots, X_n \stackrel{\text{i.i.d.}}{\sim} U(\theta, \theta+1),即服从区间 [θ,θ+1][\theta, \theta+1] 上的均匀分布。可以证明,任何满足 X(n)1θ^X(1)X_{(n)} - 1 \le \hat{\theta} \le X_{(1)} 的统计量(其中 X(1)X_{(1)} 为最小次序统计量,X(n)X_{(n)} 为最大次序统计量)都是 θ\theta 的极大似然估计。例如 θ^=X(1)\hat{\theta} = X_{(1)}θ^=X(n)1\hat{\theta} = X_{(n)} - 1 都是。

既然一个参数 θ\theta 可能有多个估计量 θ^1,θ^2,\hat{\theta}_1, \hat{\theta}_2, \ldots,自然就产生了一个问题:如何从这些估计量中选取一个“较好”的? 这需要一套评价估计量优良性的准则。本节主要介绍以下五种常用准则:

  1. 无偏性
  2. 相合性(一致性)
  3. 渐近正态性
  4. 无偏估计的有效性
  5. 有偏估计的均方误差准则

我们的逻辑脉络是:首先希望找到一个在均方误差(Mean Squared Error, MSE) 意义下全局最优的估计量。均方误差定义为 MSE(θ^)=E[(θ^θ)2]MSE(\hat{\theta}) = E[(\hat{\theta} - \theta)^2],它综合衡量了估计量偏离真实值的程度。遗憾的是,这样的“一致最小均方误差估计”通常不存在。因此,我们退而求其次,将搜索范围限制在“无偏估计”这一类中。在无偏估计类中,由于偏差为零,MSE(θ^)=Var(θ^)MSE(\hat{\theta}) = Var(\hat{\theta}),此时寻找MSE最小的估计就等价于寻找方差最小的估计,这就是一致最小方差无偏估计(UMVUE)

无偏性:基本准则与深入理解

无偏估计的定义

X=(X1,,Xn)X = (X_1, \ldots, X_n) 是来自总体分布族 {F(x;θ):θΘ}{F(x; \theta): \theta \in \Theta} 的样本,g(θ)g(\theta) 是定义在参数空间 Θ\Theta 上的函数。若统计量 T(X)T(X) 满足: Eθ[T(X)]=g(θ),θΘE_{\theta}[T(X)] = g(\theta), \quad \forall \theta \in \Theta 则称 T(X)T(X)g(θ)g(\theta) 的一个无偏估计(Unbiased Estimator)。如果 g(θ)g(\theta) 存在无偏估计,则称 g(θ)g(\theta)可估的

特别地,当 g(θ)=θg(\theta) = \theta 时,T(X)T(X) 就是参数 θ\theta 本身的无偏估计。

渐进无偏估计

若估计量 Tn=T(X1,,Xn)T_n = T(X_1, \ldots, X_n) 不满足无偏性,但当样本量 nn \to \infty 时,其期望收敛于真实参数,即: limnEθ[Tn]=g(θ),θΘ\lim_{n \to \infty} E_{\theta}[T_n] = g(\theta), \quad \forall \theta \in \Theta 则称 TnT_ng(θ)g(\theta) 的一个渐进无偏估计

经典例子:样本方差

  • S2=1n1i=1n(XiXˉ)2S^2 = \frac{1}{n-1}\sum_{i=1}^n (X_i - \bar{X})^2 是总体方差 σ2\sigma^2无偏估计
  • Sn2=1ni=1n(XiXˉ)2S_n^2 = \frac{1}{n}\sum_{i=1}^n (X_i - \bar{X})^2 不是 σ2\sigma^2 的无偏估计,因为 E(Sn2)=n1nσ2E(S_n^2) = \frac{n-1}{n}\sigma^2。但当 nn \to \infty 时,E(Sn2)σ2E(S_n^2) \to \sigma^2,因此它是 σ2\sigma^2 的一个渐进无偏估计

对无偏性的深入辨析

  1. 偏差(Bias):若 T(X)T(X)g(θ)g(\theta) 的有偏估计,则称 b(θ)=Eθ[T(X)]g(θ)b(\theta) = E_{\theta}[T(X)] - g(\theta) 为估计量 T(X)T(X)偏差,它反映了估计的系统性误差。
  2. 无偏性的频率派解释:无偏性是一个基于“大量重复抽样”或“多次重复实验”频率思想的概念。它并不意味着基于某一次具体样本得到的估计值 θ^(x1,,xn)\hat{\theta}(x_1,\ldots,x_n) 一定等于 θ\theta,而是说,如果我们能反复独立抽取样本并用相同的估计方法计算,那么这些估计值的平均值会趋向于 θ\theta
  3. 无偏估计可能不唯一、不存在或不合理
    • 不唯一:如前所述,一个参数可能有多个无偏估计。
    • 不存在:某些参数的函数可能根本不存在无偏估计。例如,对于二项分布 B(m,p)B(m, p),可以证明无论样本量 nn 多大,函数 g(p)=1/pg(p) = 1/p 都不存在无偏估计。
    • 不合理:无偏性有时会导出不符合直觉的估计。例如,对于正态总体 N(μ,σ2)N(\mu, \sigma^2),样本标准差 S=S2S = \sqrt{S^2} 并不是总体标准差 σ\sigma 的无偏估计。更一般地,如果 TTθ\theta 的无偏估计,g(T)g(T) 通常不是 g(θ)g(\theta) 的无偏估计(除非 gg 是线性函数)。这称为无偏性的不变性缺失

刀切法:一种减小偏差的技术

当估计量存在偏差时,统计学家发展了一些技术来减小或消除偏差,刀切法(Jackknife) 就是其中一种重要方法。

基本思想:设 Tn=T(X1,,Xn)T_n = T(X_1, \ldots, X_n) 是基于全部 nn 个样本的估计量,其偏差满足 E(Tn)g(θ)=O(1/n)E(T_n) - g(\theta) = O(1/n)(即与 1/n1/n 同阶)。刀切法通过巧妙地利用“剔除一个样本”的子估计量,构造出一个新的估计量,使其偏差阶数降低到 O(1/n2)O(1/n^2),同时保证方差不会增大。

刀切估计量的构造

  1. 计算剔除第 ii 个样本后的估计量:Tn1(i)=T(X1,,Xi1,Xi+1,,Xn)T_{n-1}^{(i)} = T(X_1, \ldots, X_{i-1}, X_{i+1}, \ldots, X_n),共得到 nn 个这样的值。
  2. 定义刀切估计量 TnJackT_n^{Jack} 为: TnJack=nTnn1ni=1nTn1(i)T_n^{Jack} = n T_n - \frac{n-1}{n} \sum_{i=1}^n T_{n-1}^{(i)}

可以证明,TnJackT_n^{Jack} 的偏差为 O(1/n2)O(1/n^2),且通常 Var(TnJack)Var(Tn)Var(T_n^{Jack}) \le Var(T_n)。刀切法体现了统计学的智慧,即通过样本内部分析来改进估计性能。与之相关的另一个著名方法是 Bootstrap(自助法),由斯坦福大学的 Bradley Efron 教授提出,广泛应用于统计推断的各个领域。

无偏估计的有效性与UMVUE的引出

无偏估计的有效性

当我们限定在无偏估计类中比较估计量时,一个自然的想法是:方差越小的无偏估计越好。因为方差小意味着估计量的取值更集中,重复实验时得到的估计值波动更小,更可能接近真实参数。

定义(有效性):设 θ^1\hat{\theta}_1θ^2\hat{\theta}_2 都是参数 θ\theta 的无偏估计。如果对于所有 θΘ\theta \in \Theta,有 Var(θ^1)Var(θ^2)Var(\hat{\theta}_1) \le Var(\hat{\theta}_2) 且至少对于某个 θ\theta,不等式严格成立,则称 θ^1\hat{\theta}_1θ^2\hat{\theta}_2 更有效

有效性可以通过估计量的抽样分布直观理解:一个更有效的估计量,其分布曲线更“瘦高”(方差小),估计值落在真实参数附近的概率更大。

从均方误差(MSE)准则到UMVUE

有效性准则只比较无偏估计。如果我们想同时比较无偏和有偏估计,或者单纯追求“最接近”真实参数的估计,就需要一个更综合的指标——均方误差(MSE)

定义(均方误差):估计量 θ^\hat{\theta} 的均方误差定义为: MSE(θ^)=E[(θ^θ)2]MSE(\hat{\theta}) = E[(\hat{\theta} - \theta)^2]

MSE可以分解为方差与偏差平方之和: MSE(θ^)=E[(θ^E(θ^)+E(θ^)θ)2]=E[(θ^E(θ^))2]+[E(θ^)θ]2+2E[(θ^E(θ^))(E(θ^)θ)]=Var(θ^)+[Bias(θ^)]2\begin{aligned} MSE(\hat{\theta}) &= E[(\hat{\theta} - E(\hat{\theta}) + E(\hat{\theta}) - \theta)^2] \ &= E[(\hat{\theta} - E(\hat{\theta}))^2] + [E(\hat{\theta}) - \theta]^2 + 2E[(\hat{\theta} - E(\hat{\theta}))(E(\hat{\theta}) - \theta)] \ &= Var(\hat{\theta}) + [Bias(\hat{\theta})]^2 \end{aligned} 其中交叉项为零。

基于MSE,我们可以定义一致最小均方误差估计:如果存在估计量 θ^\hat{\theta}^,使得对于参数 θ\theta 的任意估计量 θ^\hat{\theta},都有 MSE(θ^)MSE(θ^)MSE(\hat{\theta}^) \le MSE(\hat{\theta}) 对所有 θΘ\theta \in \Theta 成立,则称 θ^\hat{\theta}^* 为一致最小均方误差估计。

然而,这样的估计量在大多数情况下不存在。因此,我们缩小搜索范围,限定在无偏估计类 U={θ^:E(θ^)=θ}\mathcal{U} = {\hat{\theta}: E(\hat{\theta}) = \theta} 中寻找。在无偏估计类中,Bias(θ^)=0Bias(\hat{\theta}) = 0,所以 MSE(θ^)=Var(θ^)MSE(\hat{\theta}) = Var(\hat{\theta})。此时,寻找MSE最小的估计就等价于寻找方差最小的无偏估计。

定义(一致最小方差无偏估计,UMVUE):设 X=(X1,,Xn)X = (X_1, \ldots, X_n) 是来自分布族 {F(x;θ):θΘ}{F(x; \theta): \theta \in \Theta} 的样本,g(θ)g(\theta) 是可估函数。如果 T(X)T^(X)g(θ)g(\theta) 的一个无偏估计,且对于 g(θ)g(\theta) 的任意无偏估计 T(X)T(X),都有 Varθ(T)Varθ(T),θΘVar_{\theta}(T^) \le Var_{\theta}(T), \quad \forall \theta \in \Theta 则称 T(X)T^*(X)g(θ)g(\theta)一致最小方差无偏估计(Uniformly Minimum Variance Unbiased Estimator),简称UMVUE。

UMVUE是在无偏性约束下我们能找到的“最优”估计,它使得估计的精度(以方差衡量)达到了最高。

一个启发性例子:均匀分布参数的估计比较

X1,,Xni.i.d.U(0,θ)X_1, \ldots, X_n \stackrel{\text{i.i.d.}}{\sim} U(0, \theta),即服从区间 [0,θ][0, \theta] 上的均匀分布。我们考虑 θ\theta 的两个估计量:

  1. 极大似然估计(MLE)θ^1=X(n)=max{X1,,Xn}\hat{\theta}1 = X{(n)} = \max{X_1, \ldots, X_n}
    • 可以计算其期望:E(θ^1)=nn+1θθE(\hat{\theta}_1) = \frac{n}{n+1}\theta \neq \theta有偏
    • 但其方差:Var(θ^1)=n(n+1)2(n+2)θ2Var(\hat{\theta}_1) = \frac{n}{(n+1)^2(n+2)}\theta^2
  2. 矩估计:由 E(X)=θ/2E(X) = \theta/2,得 θ^2=2Xˉ\hat{\theta}_2 = 2\bar{X}
    • 其期望:E(θ^2)=2(θ/2)=θE(\hat{\theta}_2) = 2 \cdot (\theta/2) = \theta无偏
    • 其方差:Var(θ^2)=4Var(Xˉ)=4θ212n=θ23nVar(\hat{\theta}_2) = 4Var(\bar{X}) = 4 \cdot \frac{\theta^2}{12n} = \frac{\theta^2}{3n}

比较

  • 从无偏性看θ^2\hat{\theta}_2(矩估计)优于 θ^1\hat{\theta}_1(MLE)。
  • 从方差看:当 n2n \ge 2 时,可以验证 Var(θ^1)<Var(θ^2)Var(\hat{\theta}_1) < Var(\hat{\theta}_2)。例如 n=2n=2 时,Var(θ^1)=θ2/18Var(\hat{\theta}_1) = \theta^2/18Var(θ^2)=θ2/6Var(\hat{\theta}_2) = \theta^2/6,显然 θ^1\hat{\theta}_1 的方差更小。
  • 从MSE看
    • MSE(θ^1)=Var(θ^1)+[Bias(θ^1)]2=nθ2(n+1)2(n+2)+(θn+1)2=2θ2(n+1)(n+2)MSE(\hat{\theta}_1) = Var(\hat{\theta}_1) + [Bias(\hat{\theta}_1)]^2 = \frac{n\theta^2}{(n+1)^2(n+2)} + \left(\frac{- \theta}{n+1}\right)^2 = \frac{2\theta^2}{(n+1)(n+2)}
    • MSE(θ^2)=Var(θ^2)=θ23nMSE(\hat{\theta}_2) = Var(\hat{\theta}_2) = \frac{\theta^2}{3n}。 当 n3n \ge 3 时,可以证明 MSE(θ^1)<MSE(θ^2)MSE(\hat{\theta}_1) < MSE(\hat{\theta}_2)n=2n=2 时两者相等,均为 θ2/6\theta^2/6)。这意味着,综合偏差和方差来看,有偏的MLE反而比无偏的矩估计更优

这个例子深刻地说明:

  1. 单纯追求无偏性可能不是最好的选择。
  2. 均方误差(MSE)是一个更全面的评价准则,它同时权衡了估计的准确度(偏差)和精密度(方差)。
  3. 也正因如此,我们退而求其次,在无偏估计类这个子集中寻找最优(方差最小)的估计量(UMVUE),这是一个在理论和实践上都更具可操作性的目标。

下面的Python代码模拟了这个例子,验证了上述关于期望、方差和MSE的结论。

import numpy as np
import scipy.stats as stats

# 设置参数和随机种子
np.random.seed(42)
theta_true = 5.0
n = 10
num_simulations = 10000

# 存储模拟结果
estimates_mle = np.zeros(num_simulations)
estimates_mm = np.zeros(num_simulations)

# 模拟
for i in range(num_simulations):
    sample = np.random.uniform(0, theta_true, n)
    estimates_mle[i] = np.max(sample)          # MLE: X_(n)
    estimates_mm[i] = 2 * np.mean(sample)      # 矩估计: 2 * X_bar

# 计算模拟的均值、方差和MSE
bias_mle_sim = np.mean(estimates_mle) - theta_true
bias_mm_sim = np.mean(estimates_mm) - theta_true
var_mle_sim = np.var(estimates_mle, ddof=1)
var_mm_sim = np.var(estimates_mm, ddof=1)
mse_mle_sim = np.mean((estimates_mle - theta_true)**2)
mse_mm_sim = np.mean((estimates_mm - theta_true)**2)

# 理论值
n = 10
theta = theta_true
bias_mle_theory = (n/(n+1) - 1) * theta
var_mle_theory = (n / ((n+1)**2 * (n+2))) * theta**2
mse_mle_theory = (2 / ((n+1)*(n+2))) * theta**2

bias_mm_theory = 0
var_mm_theory = (theta**2) / (3*n)
mse_mm_theory = var_mm_theory

print(f"真实参数 theta = {theta_true}, 样本量 n = {n}")
print("-" * 50)
print("极大似然估计 (MLE, 有偏):")
print(f"  模拟偏差: {bias_mle_sim:.4f}, 理论偏差: {bias_mle_theory:.4f}")
print(f"  模拟方差: {var_mle_sim:.4f}, 理论方差: {var_mle_theory:.4f}")
print(f"  模拟MSE : {mse_mle_sim:.4f}, 理论MSE : {mse_mle_theory:.4f}")
print()
print("矩估计 (无偏):")
print(f"  模拟偏差: {bias_mm_sim:.4f}, 理论偏差: {bias_mm_theory:.4f}")
print(f"  模拟方差: {var_mm_sim:.4f}, 理论方差: {var_mm_theory:.4f}")
print(f"  模拟MSE : {mse_mm_sim:.4f}, 理论MSE : {mse_mm_theory:.4f}")
print("-" * 50)
print(f"结论:在此设定下,MLE的MSE ({mse_mle_sim:.4f}) {'<' if mse_mle_sim < mse_mm_sim else '>'} 矩估计的MSE ({mse_mm_sim:.4f})")
print(f"      即有偏的MLE在均方误差意义下优于无偏的矩估计。")

📝 动手练一练

  1. 无偏性判断:设 X1,,XnX_1, \ldots, X_n 是来自总体 N(μ,σ2)N(\mu, \sigma^2) 的样本。已知样本方差 S2=1n1(XiXˉ)2S^2 = \frac{1}{n-1}\sum (X_i - \bar{X})^2σ2\sigma^2 的无偏估计。请问样本标准差 S=S2S = \sqrt{S^2} 是否是总体标准差 σ\sigma 的无偏估计?请通过查阅资料或简单推理说明原因。
  2. 有效性比较:设 X1,X2X_1, X_2 是来自总体 P(λ)P(\lambda)(泊松分布)的样本。考虑 λ\lambda 的两个无偏估计:λ^1=X1\hat{\lambda}_1 = X_1λ^2=X1+X22\hat{\lambda}_2 = \frac{X_1 + X_2}{2}。请计算并比较这两个估计量的方差,判断哪一个更有效。

参考答案:

  1. 样本标准差 SS 不是总体标准差 σ\sigma 的无偏估计。对于正态总体,E(S)=cnσE(S) = c_n \sigma,其中 cn=2n1Γ(n/2)Γ((n1)/2)<1c_n = \sqrt{\frac{2}{n-1}} \frac{\Gamma(n/2)}{\Gamma((n-1)/2)} < 1(当 n>1n>1)。因此 SS 系统地低估了 σ\sigma,是一个有偏估计,但它是渐进无偏的。
  2. Var(λ^1)=Var(X1)=λVar(\hat{\lambda}_1) = Var(X_1) = \lambdaVar(λ^2)=Var((X1+X2)/2)=14[Var(X1)+Var(X2)]=14(λ+λ)=λ/2Var(\hat{\lambda}_2) = Var((X_1+X_2)/2) = \frac{1}{4}[Var(X_1)+Var(X_2)] = \frac{1}{4}(\lambda+\lambda) = \lambda/2。因为 Var(λ^2)=λ/2<λ=Var(λ^1)Var(\hat{\lambda}_2) = \lambda/2 < \lambda = Var(\hat{\lambda}_1),所以 λ^2\hat{\lambda}_2λ^1\hat{\lambda}_1 更有效。这个例子说明,利用更多样本信息(X2X_2)的估计量通常会更有效。

本章小结

本节我们直面了参数估计中的一个核心问题:当存在多个可能的估计量时,如何评价和选择?我们引入了评价估计量优良性的基本框架。

  • 无偏性是首要准则,它要求估计量在平均意义上等于真实参数,避免了系统性误差。我们理解了无偏性的频率派解释、其可能不存在或不唯一的特点,以及无偏性不具备不变性(即无偏估计的函数不一定无偏)的重要性质。
  • 有效性是在无偏估计类内部进行比较的准则,方差越小的无偏估计越有效,意味着估计结果更稳定。
  • 均方误差(MSE) 是一个更综合、更理想的评价标准,它同时考虑了估计量的偏差和方差。然而,一致最小MSE估计通常不存在。
  • 因此,我们退而求其次,将目标锁定在寻找**一致最小方差无偏估计(UMVUE)**上,即在所有无偏估计中方差最小的那个。UMVUE是我们希望在无偏性约束下找到的“最优”估计。

行动清单

  1. 概念自查:尝试用自己的话向他人解释:为什么我们需要评价估计量的准则?无偏性和有效性分别衡量了估计的什么特性?
  2. 实例分析:回顾均匀分布 U(0,θ)U(0, \theta) 的例子,理解为什么有偏的MLE的MSE可能小于无偏的矩估计,并体会MSE准则的综合性。
  3. 预习思考:既然UMVUE如此理想,我们该如何找到它呢?请思考并预习下节课将介绍的两种核心工具:充分(完备)统计量法和C-R不等式法。

— 小象教研组

配套学习资源与课件
  • 第2章课件:点估计(PDF · 4.4MB)
    下载
🎁 免费学习资源

领取《小象 11GB VIP 课件资料包与大厂真题手册》

包含全套实战 Jupyter 源码、清洗后数据集、大厂高频面试真题与专属学员答疑交流群。

  • 完整 Python / 数据分析 Jupyter 实战源码
  • 大厂真实业务数据集与练习题
  • 微信扫码添加课程顾问,免费获取网盘下载链接
微信二维码:扫码添加课程顾问微信扫码添加顾问