矩估计
小象实战讲义 · 数据科学的统计基础
在统计推断中,参数估计是核心任务之一,它旨在利用样本信息对未知的总体参数进行推断。点估计是参数估计的一种重要形式,它试图用一个具体的数值(“点”)来估计参数。本节将介绍点估计中最基础、最直观的方法之一——矩估计。学完本节,你将掌握矩估计的核心思想与操作步骤,能够为常见分布的参数构建矩估计量,并理解其优良性质的理论基础。
💡 核心导读
- 替换原理:矩估计的统计思想,即用样本矩(如样本均值、样本方差)去“替换”总体矩,进而估计参数。
- 矩估计法:通过建立“总体矩 = 样本矩”的方程组,求解出未知参数的估计量。
- 相合性:矩估计的一个重要优良性质,即当样本量趋于无穷时,估计量会依概率收敛到真实参数。
- 理论基础:矩估计的合理性由辛钦大数定律和连续映射定理等大样本理论所保证。
替换原理与矩法估计
矩估计法(Method of Moments, MME)由统计学家卡尔·皮尔逊(Karl Pearson)于1900年提出,其核心思想被称为替换原理。该原理包含两层含义:
- 用样本矩去替换总体矩,这里的矩可以是原点矩,也可以是中心矩。
- 用样本矩的函数去替换相应的总体矩的函数。
根据替换原理,即使在总体分布形式未知的场合,我们也可以对各种参数作出估计。例如:
- 用样本均值 Xˉ 估计总体均值 μ。
- 用样本方差 S2 估计总体方差 σ2。
- 用事件 A 出现的频率 fA 估计事件 A 发生的概率 P(A)。
- 用样本的 p 分位数估计总体的 p 分位数。
矩法估计的统计思想(替换原理)十分简单明确,易于理解和接受,因此应用场合很广。其本质是用经验分布函数去替换总体分布函数,其理论基础是格列文科定理,该定理保证了经验分布函数是总体分布函数的一致相合估计。
矩估计的定义与步骤
在正式定义矩估计之前,我们先回顾样本矩与总体矩的概念。
设 X1,X2,…,Xn 是来自总体 X 的一个样本。
- 样本 k 阶原点矩:Ak=n1∑i=1nXik。
- 特别地,一阶原点矩 A1=Xˉ 即为样本均值。
- 样本 k 阶中心矩:Bk=n1∑i=1n(Xi−Xˉ)k。
- 特别地,二阶中心矩 B2 是样本方差(未修正版本)。
相应地,设总体 X 的分布函数为 F(x;θ),其中 θ=(θ1,θ2,…,θm) 是 m 维未知参数向量。
- 总体 k 阶原点矩:μk=E(Xk)。
- 总体 k 阶中心矩:νk=E[(X−E(X))k]。
矩估计法的操作流程: 假设总体 X 的前 m 阶原点矩 μ1,μ2,…,μm 存在,并且它们都是参数 θ 的函数,即: μk=gk(θ1,θ2,…,θm),k=1,2,…,m. 矩估计法的核心是建立如下方程组: ⎩⎨⎧μ1=g1(θ1,θ2,…,θm)=A1μ2=g2(θ1,θ2,…,θm)=A2⋮μm=gm(θ1,θ2,…,θm)=Am 这个方程组体现了“用样本矩替换总体矩”的思想。解此方程组,得到参数 θ 的解,记为 θ^1,θ^2,…,θ^m。由于解是样本 X1,X2,…,Xn 的函数,我们称 θ^=(θ^1,θ^2,…,θ^m) 为参数 θ 的矩估计量。
注意:矩估计不要求知道总体的具体分布形式,但要求所涉及的总体矩存在。有时为了计算方便,也可能使用中心矩来建立方程。
矩估计的实例
实例1:估计均值和方差
设总体 X 的均值 E(X)=μ,方差 Var(X)=σ2 均未知(不假定具体分布)。X1,X2,…,Xn 是来自该总体的样本,试求 μ 和 σ2 的矩估计。
解: 总体涉及两个参数 (μ,σ2),需要两个方程。我们利用一阶和二阶原点矩。
- 总体一阶原点矩:μ1=E(X)=μ。
- 总体二阶原点矩:μ2=E(X2)=Var(X)+[E(X)]2=σ2+μ2。
- 样本一阶原点矩:A1=Xˉ=n1∑i=1nXi。
- 样本二阶原点矩:A2=n1∑i=1nXi2。
建立矩估计方程: {μ=Xˉσ2+μ2=n1∑i=1nXi2 解得: {MME} = \bar{X}μ^MME=Xˉ {MME} = \frac{1}{n}\sum_{i=1}^n X_i^2 - \bar{X}^2 = \frac{1}{n}\sum_{i=1}^n (X_i - \bar{X})^2σ^MME2=n1i=1∑nXi2−Xˉ2=n1i=1∑n(Xi−Xˉ)2 因此,总体均值 μ 的矩估计是样本均值 Xˉ,总体方差 σ2 的矩估计是(未修正的)样本方差 B2。注意,这与常用的无偏样本方差 S2=n−11∑i=1n(Xi−Xˉ)2 相差一个因子,即 σ^MME2=nn−1S2。
实例2:估计均匀分布的参数
设总体 X∼U(a,b),即服从区间 [a,b] 上的均匀分布,其概率密度函数为: f(x;a,b)={b−a1,0,a≤x≤b其他 其中 a<b,且 a,b 未知。X1,X2,…,Xn 是来自该总体的样本,试求 a 和 b 的矩估计。
解: 均匀分布的均值和方差为: E(X)=2a+b,Var(X)=12(b−a)2 根据实例1的结论,我们可以直接用样本矩来估计总体均值和方差: E^(X)=Xˉ,Var(X)=n1i=1∑n(Xi−Xˉ)2 现在,a 和 b 是总体矩的函数。我们需要“用样本矩的函数去替换总体矩的函数”。令: {2a^+b^=Xˉ12(b^−a^)2=n1∑i=1n(Xi−Xˉ)2 记 B2=n1∑i=1n(Xi−Xˉ)2。解此方程组: 由第二式得:b^−a^=12B2。 结合第一式 a^+b^=2Xˉ,解得: {MME} = \bar{X} - \sqrt{3 B_2}, \quad \hat{b}{MME} = \bar{X} + \sqrt{3 B_2}a^MME=Xˉ−3B2,b^MME=Xˉ+3B2 这就是参数 a 和 b 的矩估计量。
import numpy as np
from scipy import stats
# 设置随机种子以确保结果可复现
np.random.seed(2025)
# 模拟参数
true_a, true_b = 3, 8
sample_size = 1000
# 从均匀分布 U(3, 8) 中生成样本
sample = np.random.uniform(true_a, true_b, sample_size)
# 计算样本矩
sample_mean = np.mean(sample)
sample_var_mme = np.var(sample, ddof=0) # ddof=0 计算的是 (1/n)*Σ(xi-mean)^2,即矩估计方差
# 根据矩估计公式计算 a 和 b 的估计值
b2 = sample_var_mme
a_hat_mme = sample_mean - np.sqrt(3 * b2)
b_hat_mme = sample_mean + np.sqrt(3 * b2)
print(f"真实参数: a = {true_a}, b = {true_b}")
print(f"样本均值: {sample_mean:.4f}, 样本矩估计方差(B2): {b2:.4f}")
print(f"矩估计结果: â = {a_hat_mme:.4f}, b̂ = {b_hat_mme:.4f}")
print(f"估计误差: Δa = {a_hat_mme - true_a:.4f}, Δb = {b_hat_mme - true_b:.4f}")
矩估计的相合性
评价一个估计量的优劣有多种准则,如无偏性、有效性等。相合性(Consistency)是一个关于大样本(样本量 n→∞)的优良性质,它要求估计量随着样本信息的增加而越来越接近真实参数。
定义(相合估计):设 n(X_1, X_2, \ldots, X_n)θ^n=θ^n(X1,X2,…,Xn) 是参数 θ 的一个估计量。如果对于任意 ϵ>0,都有 {n \to \infty} P(|\hat{\theta}_n - \theta| \ge \epsilon) = 0n→∞limP(∣θ^n−θ∣≥ϵ)=0 则称 θ^n 是 θ 的相合估计,或称 θ^n 依概率收敛于 θ,记作 θ^nPθ。
矩估计具有相合性,其理论基础是以下两个重要定理:
- 辛钦大数定律:设 X1,X2,…,Xn 独立同分布,且 E(X1)=μ 存在,则样本均值 XˉnPμ。更一般地,若 E(∣X1k∣) 存在,则样本 k 阶原点矩 AkPμk。
- 连续映射定理:如果 {n1}, \ldots, \hat{\theta}{nk}θ^n1,…,θ^nk 分别是 θ1,…,θk 的相合估计,且函数 g 在点 (θ1,…,θk) 处连续,则 {n1}, \ldots, \hat{\theta}{nk})g(θ^n1,…,θ^nk) 是 g(θ1,…,θk) 的相合估计。
矩估计量是样本矩的函数。由辛钦大数定律,样本矩 Ak 是总体矩 μk 的相合估计。在矩估计的求解过程中,我们通过连续函数(求解方程组的反函数)将样本矩映射为参数估计 θ^。根据连续映射定理,θ^ 就是 θ 的相合估计。
此外,判断一个估计量是否相合,还有一个实用的充分条件定理: 定理:如果估计量 θ^n 满足:
- 渐近无偏性:limn→∞E(θ^n)=θ。
- 方差趋于零:limn→∞Var(θ^n)=0。 则 θ^n 是 θ 的相合估计。
证明思路(利用切比雪夫不等式): 对于任意 ϵ>0,由切比雪夫不等式有: n)}{\epsilon^2}P(∣θ^n−E(θ^n)∣≥2ϵ)≤ϵ24Var(θ^n) 由于 {n \to \infty} E(\hat{\theta}_n) = \thetalimn→∞E(θ^n)=θ,当 n 充分大时,∣E(θ^n)−θ∣<2ϵ。此时,若 ∣θ^n−E(θ^n)∣<2ϵ,根据三角不等式必有 ∣θ^n−θ∣<ϵ。因此, {∣θ^n−θ∣≥ϵ}⊂{∣θ^n−E(θ^n)∣≥2ϵ} 从而 P(∣θ^n−θ∣≥ϵ)≤P(∣θ^n−E(θ^n)∣≥2ϵ)≤ϵ24Var(θ^n) 当 n→∞ 时,由条件 Var(θ^n)→0,可得上式右端趋于 0,故 θ^nPθ。
📝 动手练一练
伽马分布的矩估计:设总体 X∼Γ(α,λ),其概率密度函数为 f(x;α,λ)=Γ(α)λαxα−1e−λx,x>0,其中形状参数 α>0,尺度参数 λ>0 均未知。已知 E(X)=α/λ, Var(X)=α/λ2。设 X1,X2,…,Xn 为来自该总体的样本,试求参数 α 和 λ 的矩估计量 {MME}α^MME 和 {MME}λ^MME。
相合性判断:设 X1,X2,…,Xn 是来自总体 X 的样本,E(X)=μ, Var(X)=σ2。考虑总体均值 μ 的两个估计量: μ^1=Xˉ(样本均值), μ^2=X1(第一个观测值)。 请判断这两个估计量是否满足:(a) 无偏性;(b) 相合性(可利用本节介绍的充分条件定理)。
参考答案:
建立矩估计方程: {α/λ=Xˉα/λ2=B2=n1∑i=1n(Xi−Xˉ)2 解得:{MME} = \frac{\bar{X}}{B_2}λ^MME=B2Xˉ, {MME} = \frac{\bar{X}^2}{B_2}α^MME=B2Xˉ2。
(a) 无偏性:E(μ^1)=μ, 无偏;E(μ^2)=μ, 无偏。 (b) 相合性:
- 对于 μ^1=Xˉ:E(Xˉ)=μ (无偏), Var(Xˉ)=σ2/n→0 (当 n→∞)。满足相合性充分条件,故是相合估计。
- 对于 μ^2=X1:E(X1)=μ (无偏),但 X1 的分布不随 n 变化:对任意固定的 ε>0,P(∣X1−μ∣≥ε) 是一个与 n 无关的正常数(例如正态总体下 P(∣X1−μ∣≥σ)≈0.317),不会随 n→∞ 趋于 0。按相合性的定义,X1 不是 μ 的相合估计。直观上,无论样本多大,μ^2 只用了第一个样本的信息,精度不会提高。
本章小结
本节系统介绍了点估计中的矩估计法。
- 核心思想:替换原理——用样本矩及其函数替换总体矩及其函数。
- 操作步骤:1) 计算总体前 m 阶矩(表示为参数的函数);2) 计算对应的样本矩;3) 令总体矩等于样本矩,建立方程组;4) 解方程组得到参数的矩估计量。
- 主要性质:矩估计量通常具有相合性,这是由辛钦大数定律和连续映射定理保证的优良大样本性质。
- 优点与局限:思想直观、计算简单、无需知道总体具体分布(只需矩存在)。但矩估计可能不唯一,有时效率不如其他估计方法(如极大似然估计)。
行动清单
- 巩固概念:用自己的话复述“替换原理”的两层含义,并举例说明。
- 动手推导:针对正态分布 N(μ,σ2),独立推导其参数 μ 和 σ2 的矩估计量,并与实例1的结果进行比较。
- 代码验证:修改本节Python示例,将其应用于练习1的伽马分布。使用
scipy.stats.gamma.rvs 生成模拟数据,分别计算矩估计值与真实参数,观察样本量增大时估计精度的变化。
— 小象教研组