← 返回《数据科学的统计基础》
📑 查看全课大纲(第 14 / 41 节)

相合估计

约 22 分钟

📺 正在播放小象官方高清录播(支持倍速与清晰度调节)

相合估计

小象实战讲义 · 数据科学的统计基础

在前面的学习中,我们主要是在样本量固定的前提下,讨论估计量的无偏性、有效性等性质。然而,在实际的数据科学研究和应用中,我们常常关心当样本量无限增大时,估计量的表现会如何。本节将介绍估计量最重要的大样本性质——相合性相合渐近正态性。它们是评价一个估计方法理论可靠性的基石,也是后续区间估计和假设检验的重要理论基础。学完本节,你将理解为何我们能够放心地使用样本均值、样本方差等统计量去推断总体,并了解这些结论背后的理论保障。

💡 核心导读

  • 从“固定样本”到“大样本”:理解为何需要研究估计量在样本量趋于无穷时的性质,以及相合性作为大样本性质的核心地位。
  • 相合性的严格定义:掌握弱相合(依概率收敛)、强相合(以概率1收敛)和均方相合(r阶矩收敛)的定义及其相互关系。
  • 常见估计的相合性:了解样本矩、样本分位数、极大似然估计等常用估计量在何种条件下具有相合性,并能运用相关定理进行判断。
  • 更精细的刻画:相合渐近正态性:学习比相合性更强的性质,它描述了估计量在收敛时的分布形态(渐近正态分布)和收敛速度,是构建置信区间和进行假设检验的关键。
  • 理论的应用价值:认识到这些理论性质并非空中楼阁,它们为数据科学实践中广泛使用的估计方法(如MLE)提供了坚实的理论支撑,让我们可以“放心大胆地用”。

大样本性质概述

在之前关于无偏性、有效性和均方误差的讨论中,我们始终固定样本量 nn。这些性质刻画了在给定样本规模下,一个估计量的“平均”表现或“最坏”表现。

然而,一个理想的估计量,除了在有限样本下表现良好,还应具备这样的性质:随着我们收集的数据越来越多(即样本量 nn \to \infty),它应该无限地接近我们想要估计的真实参数值。这种当样本量趋于无穷时表现出的性质,称为大样本性质渐近性质

在理论研究和实际应用中,大样本性质至关重要。例如,在顶级统计学杂志的论文中,提出一种新的估计方法后,除了进行数值模拟和实证分析,一个必不可少的环节就是证明该方法满足相合性和相合渐近正态性。这两个性质是大样本理论的核心。

相合性的定义与分类

相合估计(弱相合)

Tn=Tn(X1,,Xn)T_n = T_n(X_1, \dots, X_n) 是总体参数 g(θ)g(\theta) 的一个估计量,下标 nn 强调它是基于 nn 个样本的函数。

定义(弱相合估计):如果当 nn \to \infty 时,TnT_n 依概率收敛g(θ)g(\theta),即对任意 θΘ\theta \in \Theta 和任意 ε>0\varepsilon > 0,有 limnPθ(Tng(θ)ε)=0,\lim_{n \to \infty} P_\theta \left( |T_n - g(\theta)| \ge \varepsilon \right) = 0, 则称 TnT_ng(θ)g(\theta) 的一个相合估计。通常所说的“相合估计”默认指弱相合估计。

依概率收敛的含义是,当样本量足够大时,估计量 TnT_n 与真实值 g(θ)g(\theta) 的差距大于任意给定正数 ε\varepsilon 的概率可以变得任意小。这保证了估计的“准确性”随着数据量的增加而提高。

强相合估计

定义(强相合估计):如果当 nn \to \infty 时,TnT_n 以概率1收敛(或几乎必然收敛)于 g(θ)g(\theta),则称 TnT_ng(θ)g(\theta) 的一个强相合估计

以概率1收敛是比依概率收敛更强的一种收敛模式。由强大数定律可以推出强相合性,而由弱大数定律可以推出弱相合性。在大多数统计应用中,弱相合性已足够,强相合性更多出现在理论分析中。

r阶矩相合估计

定义(r阶矩相合估计):如果当 nn \to \infty 时,TnT_n 以r阶矩收敛g(θ)g(\theta),即 limnEθ[Tng(θ)r]=0,\lim_{n \to \infty} E_\theta \left[ |T_n - g(\theta)|^r \right] = 0, 则称 TnT_ng(θ)g(\theta) 的一个r阶矩相合估计

特别地,当 r=2r=2 时,称为均方相合估计。均方相合意味着估计的均方误差趋于零。

性质间的包含关系

这些不同强度的相合性之间存在明确的包含关系:

  • 强相合 \Rightarrow 弱相合。
  • r阶矩相合 \Rightarrow 弱相合。 反之则不成立。这些关系反映了对估计量“收敛”要求的不同严格程度。

示例:设 X1,,Xni.i.d.Bernoulli(p)X_1, \dots, X_n \stackrel{\text{i.i.d.}}{\sim} Bernoulli(p)。由(弱)大数定律知,样本均值 Xˉ=1ni=1nXi\bar{X} = \frac{1}{n}\sum_{i=1}^n X_i 依概率收敛于总体均值 pp。因此,Xˉ\bar{X}pp 的一个(弱)相合估计。

相合性的判定定理与常见估计

我们不加证明地给出一些判定相合性的有用定理,它们大多可由概率论中的大数定律和斯拉茨基(Slutsky)定理导出。

定理 1(样本矩的相合性):设 X1,,XnX_1, \dots, X_n 是来自某总体的独立同分布样本,且总体的 kk 阶原点矩 μk=E(Xk)\mu_k = E(X^k) 存在。则样本的 kk 阶原点矩 Ak=1ni=1nXikA_k = \frac{1}{n}\sum_{i=1}^n X_i^kμk\mu_k 的相合估计。 这本质上是辛钦大数定律的直接推论。

定理 2(相合估计的连续变换):设 TnT_nθ\theta 的相合估计,函数 g(x)g(x)x=θx=\theta 处连续,则 g(Tn)g(T_n)g(θ)g(\theta) 的相合估计。 这表明相合性在连续变换下具有不变性,是一个非常实用的性质。

定理 3(无偏估计的相合性条件):设 TnT_ng(θ)g(\theta)渐近无偏估计(即 limnE(Tn)=g(θ)\lim_{n \to \infty} E(T_n) = g(\theta)),且 limnVar(Tn)=0\lim_{n \to \infty} Var(T_n) = 0,则 TnT_ng(θ)g(\theta) 的相合估计。 证明:对任意 ε>0\varepsilon > 0,由切比雪夫不等式, P(Tng(θ)ε)E[(Tng(θ))2]ε2=Var(Tn)+[E(Tn)g(θ)]2ε2.P(|T_n - g(\theta)| \ge \varepsilon) \le \frac{E[(T_n - g(\theta))^2]}{\varepsilon^2} = \frac{Var(T_n) + [E(T_n) - g(\theta)]^2}{\varepsilon^2}. 由渐近无偏性和方差趋于零,可知上式右边趋于零。

样本分位数的相合性

分位数是描述数据分布位置的重要特征,样本中位数就是 p=0.5p=0.5 的样本分位数。

总体 pp 分位数定义为:ξp=inf{x:F(x)p}\xi_p = \inf { x: F(x) \ge p },其中 F(x)F(x) 是总体分布函数。对于连续分布,通常满足 F(ξp)=pF(\xi_p) = p

定理:设 F(x)F(x) 是总体分布函数,ξp\xi_p 是其 pp 分位数。如果 F(x)F(x)ξp\xi_p 处连续且 F(ξp)=f(ξp)>0F’(\xi_p) = f(\xi_p) > 0,则样本 pp 分位数 ξ^p\hat{\xi}_pξp\xi_p 的相合估计。 这个定理保证了,当样本量很大时,用样本分位数估计总体分位数是可靠的。

极大似然估计 (MLE) 的相合性

极大似然估计是参数估计中最重要、应用最广泛的方法之一,其相合性有坚实的理论保障。

定理(MLE的相合性):设总体分布族 {f(x;θ):θΘ}{ f(x; \theta): \theta \in \Theta } 满足一定的正则条件(包括可识别性、对数似然函数关于参数的可微性等)。这里,可识别性是指不同的参数值对应不同的分布,即若 θθ\theta \ne \theta’,则集合 {x:f(x;θ)f(x;θ)}{ x: f(x; \theta) \ne f(x; \theta’) } 的测度不为零。则在样本量 nn \to \infty 时,似然方程以概率1有解,且该解(即MLE θ^MLE\hat{\theta}_{MLE})是 θ\theta 的强相合估计。

这个结论告诉我们,在很一般的条件下,极大似然估计量会随着样本量的增加而收敛到真实的参数值。这是我们在实践中可以“放心大胆地用”MLE的重要理论依据。

相合渐近正态估计 (CAN)

相合性只告诉我们估计量最终会靠近真值,但没有说明“以多快的速度靠近”以及“靠近时的波动情况”。相合渐近正态估计给出了更精细的刻画。

定义(相合渐近正态估计):设 TnT_ng(θ)g(\theta) 的一个相合估计量。如果存在与 nnθ\theta 有关的函数 μn(θ)>0\mu_n(\theta) > 0σn(θ)>0\sigma_n(\theta) > 0,使得当 nn \to \infty 时, Tnμn(θ)σn(θ)dN(0,1),\frac{T_n - \mu_n(\theta)}{\sigma_n(\theta)} \stackrel{d}{\longrightarrow} N(0, 1), 即依分布收敛于标准正态分布,则称 TnT_ng(θ)g(\theta) 的一个相合渐近正态估计。其中 μn(θ)\mu_n(\theta) 称为渐近均值σn(θ)\sigma_n(\theta) 称为渐近标准差

这个定义表明,当样本量很大时,估计量 TnT_n 经过标准化后,其分布近似于标准正态分布。这一定义本身蕴含了 TnT_nμn(θ)\mu_n(\theta) 的相合估计。通常,我们希望 μn(θ)=g(θ)\mu_n(\theta) = g(\theta),即估计量是渐近无偏的。

常见估计的相合渐近正态性

  1. 样本分位数:在总体密度函数 f(x)f(x)pp 分位数 ξp\xi_p 处连续且 f(ξp)>0f(\xi_p) > 0 的条件下,样本 pp 分位数 ξ^p\hat{\xi}_p 是相合渐近正态的,且 n(ξ^pξp)dN(0,p(1p)[f(ξp)]2).\sqrt{n}(\hat{\xi}_p - \xi_p) \stackrel{d}{\longrightarrow} N\left(0, \frac{p(1-p)}{[f(\xi_p)]^2}\right).p=0.5p=0.5 时,就得到样本中位数的渐近分布。

  2. 矩估计:矩估计也具有相合渐近正态性,但所需条件较严格。设待估参数 g(θ)g(\theta) 可表示为总体前 kk 阶矩 μ1,,μk\mu_1, \dots, \mu_k 的函数,即 g(θ)=G(μ1,,μk)g(\theta) = G(\mu_1, \dots, \mu_k)。若总体的 2k2k 阶矩存在,且函数 GG 对各变量一阶连续可微,则矩估计 g^=G(A1,,Ak)\hat{g} = G(A_1, \dots, A_k)AjA_j 为样本 jj 阶原点矩)是相合渐近正态的。其渐近方差表达式涉及函数 GG 的梯度向量和样本矩的协方差矩阵,形式较为复杂。

  3. 极大似然估计 (MLE):这是最重要的一类CAN估计。在很一般的正则条件下(参数空间为开集,密度函数对参数三阶可导,Fisher信息量正定等),MLE θ^MLE\hat{\theta}{MLE} 不仅是强相合的,而且是相合渐近正态的,并且具有最优的渐近方差: n(θ^MLEθ)dN(0,1I(θ)),\sqrt{n}(\hat{\theta}{MLE} - \theta) \stackrel{d}{\longrightarrow} N\left(0, \frac{1}{I(\theta)}\right), 其中 I(θ)I(\theta) 是单样本的 Fisher 信息量。这意味着 MLE 的渐近方差达到了 Cramér-Rao 下界,是渐近有效的。这个结论为后续基于 MLE 构建置信区间和进行假设检验(如 Wald 检验、似然比检验)奠定了核心理论基础。

import numpy as np
import scipy.stats as stats
import matplotlib.pyplot as plt

# 设置随机种子保证结果可复现
np.random.seed(321)

# 模拟验证:样本均值的相合性与渐近正态性
true_mu = 5.0
true_sigma = 2.0
sample_sizes = [10, 30, 100, 500]
num_simulations = 5000

fig, axes = plt.subplots(2, 2, figsize=(10, 8))
axes = axes.ravel()

for idx, n in enumerate(sample_sizes):
    sample_means = []
    for _ in range(num_simulations):
        # 从正态分布 N(5, 4) 中抽取 n 个样本
        sample = np.random.normal(loc=true_mu, scale=true_sigma, size=n)
        sample_means.append(np.mean(sample))
    
    sample_means = np.array(sample_means)
    
    # 绘制样本均值的分布直方图
    axes[idx].hist(sample_means, bins=40, density=True, alpha=0.6, color='skyblue', edgecolor='black')
    
    # 绘制理论渐近正态分布曲线
    # 样本均值的理论分布:N(true_mu, true_sigma^2/n)
    x = np.linspace(true_mu - 3*true_sigma/np.sqrt(n), true_mu + 3*true_sigma/np.sqrt(n), 200)
    y = stats.norm.pdf(x, loc=true_mu, scale=true_sigma/np.sqrt(n))
    axes[idx].plot(x, y, 'r-', linewidth=2, label=f'N({true_mu}, {true_sigma**2/n:.3f})')
    
    axes[idx].set_title(f'Sample Size n = {n}')
    axes[idx].set_xlabel('Sample Mean')
    axes[idx].set_ylabel('Density')
    axes[idx].legend()
    axes[idx].grid(True, alpha=0.3)

plt.suptitle('Simulation: Consistency and Asymptotic Normality of Sample Mean', fontsize=14)
plt.tight_layout()
plt.show()

# 计算并展示相合性:不同样本量下,样本均值与真值差距大于epsilon的概率
epsilon = 0.2
prob_large_error = []
for n in sample_sizes:
    errors = []
    for _ in range(num_simulations):
        sample = np.random.normal(loc=true_mu, scale=true_sigma, size=n)
        sample_mean = np.mean(sample)
        errors.append(1 if abs(sample_mean - true_mu) > epsilon else 0)
    prob = np.mean(errors)
    prob_large_error.append(prob)
    print(f"n={n:3d}: P(|X̄ - μ| > {epsilon}) ≈ {prob:.4f}")

print("\n结论:随着样本量 n 增大,样本均值偏离真实均值的概率逐渐减小,直观展示了相合性。")

📝 动手练一练

  1. 相合性的判断:设 X1,,Xni.i.d.Uniform(0,θ)X_1, \dots, X_n \stackrel{\text{i.i.d.}}{\sim} Uniform(0, \theta),其中 θ>0\theta > 0。考虑两个估计量: a) T1n=2XˉT_{1n} = 2\bar{X} (样本均值的两倍) b) T2n=X(n)T_{2n} = X_{(n)} (最大次序统计量) 请问 T1nT_{1n}T2nT_{2n} 是否是 θ\theta 的相合估计?请说明理由。

  2. 渐近正态性的应用:假设某电子元件的寿命 XX(单位:千小时)服从指数分布 Exp(λ)Exp(\lambda),其概率密度函数为 f(x;λ)=λeλx,x>0f(x; \lambda) = \lambda e^{-\lambda x}, \quad x > 0。现随机抽取 n=100n=100 个元件进行测试,得到样本均值为 xˉ=1.2\bar{x} = 1.2。 a) 写出参数 λ\lambda 的极大似然估计 λ^MLE\hat{\lambda}{MLE}。 b) 利用极大似然估计的相合渐近正态性,近似计算 λ^MLE\hat{\lambda}{MLE} 的标准误(即渐近标准差)。 (提示:指数分布 Exp(λ)Exp(\lambda) 的 Fisher 信息量为 I(λ)=1/λ2I(\lambda) = 1/\lambda^2

参考答案:

  1. a) E(T1n)=2E(Xˉ)=2(θ/2)=θE(T_{1n}) = 2E(\bar{X}) = 2 \cdot (\theta/2) = \theta,故 T1nT_{1n} 是无偏估计。Var(T1n)=4Var(Xˉ)=4(θ2/(12n))=θ2/(3n)0Var(T_{1n}) = 4Var(\bar{X}) = 4 \cdot (\theta^2/(12n)) = \theta^2/(3n) \to 0。根据定理3(无偏+方差趋于零),T1nT_{1n}θ\theta 的相合估计。 b) T2n=X(n)T_{2n} = X_{(n)}θ\theta 的极大似然估计。可以证明 E(T2n)=nn+1θE(T_{2n}) = \frac{n}{n+1}\theta(有偏),但 Bias0Bias \to 0,且 Var(T2n)=nθ2(n+1)2(n+2)0Var(T_{2n}) = \frac{n\theta^2}{(n+1)^2(n+2)} \to 0。因此它也是渐近无偏且方差趋于零,故 T2nT_{2n} 同样是 θ\theta 的相合估计。
  2. a) 对于指数分布 Exp(λ)Exp(\lambda)λ^MLE=1/Xˉ\hat{\lambda}{MLE} = 1/\bar{X}。代入数据得 λ^MLE=1/1.20.8333\hat{\lambda}{MLE} = 1/1.2 \approx 0.8333。 b) 由 MLE 的渐近性质,n(λ^MLEλ)dN(0,1/I(λ))\sqrt{n}(\hat{\lambda}{MLE} - \lambda) \stackrel{d}{\approx} N(0, 1/I(\lambda)),其中 I(λ)=1/λ2I(\lambda)=1/\lambda^2。因此,λ^MLE\hat{\lambda}{MLE} 的渐近方差为 Varasym(λ^MLE)1nI(λ)=λ2nVar_{asym}(\hat{\lambda}{MLE}) \approx \frac{1}{n I(\lambda)} = \frac{\lambda^2}{n}。用估计值 λ^MLE\hat{\lambda}{MLE} 代替 λ\lambda,得到标准误的估计:SE(λ^MLE)λ^MLE2n=0.8333100=0.08333SE(\hat{\lambda}{MLE}) \approx \sqrt{\frac{\hat{\lambda}{MLE}^2}{n}} = \frac{0.8333}{\sqrt{100}} = 0.08333

本章小结

本节我们深入探讨了估计量的大样本性质,这是评价一个估计方法理论可靠性的关键。

  • 核心概念相合性(弱、强、均方)描述了估计量随着样本量增大而“收敛”到真实参数的性质。相合渐近正态性则给出了更精细的刻画,说明了估计量在收敛时的分布形态(正态分布)和速度。
  • 理论基石:这些性质的证明大多依赖于概率论中的大数定律中心极限定理
  • 重要结论:在相当一般的条件下,我们常用的样本矩样本分位数极大似然估计等都具有相合性,并且许多(尤其是MLE)还具有相合渐近正态性。MLE的渐近方差达到Cramér-Rao下界,是渐近最优的。
  • 实践意义:这些理论保证了我们在数据科学实践中使用这些经典估计方法是合理的。特别是相合渐近正态性,为后续构建参数的置信区间和进行假设检验提供了直接的理论工具(例如,基于MLE的Wald区间)。

行动清单

  1. 理解收敛模式:回顾概率论中“依概率收敛”、“以概率1收敛”、“依分布收敛”的定义与区别,这是理解本节内容的基础。
  2. 定理应用:尝试用“无偏(或渐近无偏)+ 方差趋于零 ⇒ 相合”这一定理,去判断一些简单估计量的相合性。
  3. 联系后续章节:提前思考:如果已知一个估计量是相合渐近正态的,如何利用这个结论来构造该参数的近似置信区间?这将直接衔接下一章《区间估计》的内容。

— 小象教研组

配套学习资源与课件
  • 第2章课件:点估计(PDF · 4.4MB)
    下载
🎁 免费学习资源

领取《小象 11GB VIP 课件资料包与大厂真题手册》

包含全套实战 Jupyter 源码、清洗后数据集、大厂高频面试真题与专属学员答疑交流群。

  • 完整 Python / 数据分析 Jupyter 实战源码
  • 大厂真实业务数据集与练习题
  • 微信扫码添加课程顾问,免费获取网盘下载链接
微信二维码:扫码添加课程顾问微信扫码添加顾问