← 返回《数据科学的统计基础》
📑 查看全课大纲(第 2 / 41 节)

统计量与抽样分布(一)

约 56 分钟

📺 正在播放小象官方高清录播(支持倍速与清晰度调节)

统计量与抽样分布

小象实战讲义 · 数据科学的统计基础

在上一节我们建立了从总体到样本的基本框架。然而,原始样本数据往往杂乱无章,直接用于推断总体效率低下。本节我们将学习统计学的核心工具——统计量。它是样本信息的压缩与提炼,是连接样本与总体的桥梁。通过学习统计量的定义、性质以及其分布(抽样分布),你将掌握构建后续参数估计与假设检验理论的基础,并理解为何样本均值、样本方差等是我们最常用的统计推断工具。

💡 核心导读

  • 统计量的本质:不含任何未知参数的样本函数。它既是随机变量(抽样前),也是确定的数值(抽样后)。
  • 统计量的核心地位:统计推断的本质,就是通过构造合适的统计量,对样本信息进行压缩,进而推断总体特征。
  • 估计量与无偏性:用于估计未知参数的统计量称为估计量。无偏性是衡量估计量优劣的首要准则,它意味着估计量在平均意义下等于待估参数。
  • 常用统计量家族:样本均值、样本方差、样本矩、样本偏度与峰度、次序统计量等,它们各自承担着描述数据不同特征(位置、离散度、形态)的使命。
  • 矩估计思想初探:用样本矩估计总体矩,是参数估计中矩估计法的核心思想,为我们提供了一种直观的参数估计方法。

统计量的定义与理解

从简单随机样本出发

X1,X2,,XnX_1, X_2, \ldots, X_n 是来自总体 XX 的一个简单随机样本。这意味着:

  1. 独立性X1,X2,,XnX_1, X_2, \ldots, X_n 相互独立。
  2. 同分布性X1,X2,,XnX_1, X_2, \ldots, X_n 与总体 XX 服从相同的分布。

简记为 X1,X2,,Xni.i.d.XX_1, X_2, \ldots, X_n \stackrel{\text{i.i.d.}}{\sim} X。简单随机样本是统计推断中最基本、最重要的样本类型,它保证了样本能较好地代表总体,并且具有许多优良的数学性质。

统计量的正式定义

T=T(X1,X2,,Xn)T = T(X_1, X_2, \ldots, X_n) 是样本 X1,X2,,XnX_1, X_2, \ldots, X_n 的一个 nn 元函数。若 TT 不包含任何关于总体的未知参数,则称 TT 为一个统计量

更简洁地说:不含任何未知参数的样本函数称为统计量

理解统计量的两重性

  • 抽样前:由于样本 X1,X2,,XnX_1, X_2, \ldots, X_n 是随机变量,因此统计量 TT 也是随机变量。它拥有自己的概率分布,这个分布被称为抽样分布
  • 抽样后:当我们获得一组具体的样本观测值 x1,x2,,xnx_1, x_2, \ldots, x_n 后,代入统计量 TT,就能得到一个确定的数值 t=T(x1,x2,,xn)t = T(x_1, x_2, \ldots, x_n)。这个数值就是统计量的一次实现。

示例辨析:设从总体 XN(μ,σ2)X \sim N(\mu, \sigma^2) 中抽取样本 X1,X2,,XnX_1, X_2, \ldots, X_n,其中 μ,σ2\mu, \sigma^2 未知。判断下列哪些是统计量:

  1. T1=12(X1+X2)T_1 = \frac{1}{2}(X_1 + X_2)
  2. T2=X1+X22μT_2 = X_1 + X_2 - 2\mu
  3. T3=X1μσT_3 = \frac{X_1 - \mu}{\sigma}
  4. T4=Xˉ105T_4 = \frac{\bar{X} - 10}{5},其中 Xˉ=1ni=1nXi\bar{X} = \frac{1}{n}\sum_{i=1}^{n} X_i
  5. T5=1ni=1n(XiS)2T_5 = \frac{1}{n}\sum_{i=1}^{n} (X_i - S)^2,其中 S2=1n1i=1n(XiXˉ)2S^2 = \frac{1}{n-1}\sum_{i=1}^{n} (X_i - \bar{X})^2
  6. T6=max{X1,X2,,Xn}T_6 = \max{X_1, X_2, \ldots, X_n}

参考答案

  • T1,T4,T5,T6T_1, T_4, T_5, T_6 是统计量。它们都是样本的函数,且不包含未知参数 μ\muσ\sigma
  • T2,T3T_2, T_3 不是统计量。因为它们包含了未知的总体参数 μ\muσ\sigma

统计量在统计推断中的核心作用

回顾统计学的任务:从总体中抽样,通过样本推断总体。统计量正是完成这一任务的关键枢纽。

  1. 信息压缩:原始样本 X1,X2,,XnX_1, X_2, \ldots, X_n 包含 nn 个数据点,信息冗余且杂乱。统计量 TT 对其进行了压缩和提炼,提取出关于总体特征(如均值、方差)的关键信息。
  2. 推断的载体:无论是参数估计(用统计量估计参数)还是假设检验(构造检验统计量),其核心步骤都是构造并使用合适的统计量。

估计量与无偏性

估计量:统计量的特化

如果一个统计量 T(X1,X2,,Xn)T(X_1, X_2, \ldots, X_n) 被专门用来估计某个未知参数 θ\theta,那么我们就称 TT 为参数 θ\theta 的一个估计量,通常记作 θ^\hat{\theta}

类似地,用于假设检验的统计量称为检验统计量。因此,估计量是服务于参数估计这一特定目的的统计量。

我们关心的参数 θ\theta 通常有三类:

  1. 分布中的未知参数:如正态分布的均值 μ\mu 和方差 σ2\sigma^2,泊松分布的参数 λ\lambda 等。知道了它们,就完全确定了分布。
  2. 分布的数字特征:如总体的期望 E(X)E(X)、方差 Var(X)\operatorname{Var}(X)、标准差、分位数等。它们通常是未知参数的函数。
  3. 某事件的概率:如产品合格率 pp

无偏性:优良估计的基本要求

既然估计量 θ^\hat{\theta} 是随机变量,我们自然关心它的性质。最首要的性质是无偏性

定义:设 θ^\hat{\theta} 是参数 θ\theta 的一个估计量,若对于参数空间 Θ\Theta 中的任意 θ\theta,都有 E(θ^)=θE(\hat{\theta}) = \theta 成立,则称 θ^\hat{\theta}θ\theta 的一个无偏估计。否则,称为有偏估计。

直观理解:无偏性意味着,虽然一次估计的结果可能偏高或偏低,但如果我们进行大量重复抽样并计算估计量,这些估计值的平均值会等于参数的真值。这保证了估计量没有系统性的偏差。

渐进无偏:若估计量 θ^n\hat{\theta}_n(下标 nn 强调其依赖于样本量)不满足无偏性,但当样本量 nn \to \infty 时,有 E(θ^n)θE(\hat{\theta}_n) \to \theta,则称 θ^n\hat{\theta}_nθ\theta渐进无偏估计

无偏性的一个重要性质:不具有不变性

无偏性是一个很好的性质,但它不具有不变性。即:如果 θ^\hat{\theta}θ\theta 的无偏估计,并不能推出 g(θ^)g(\hat{\theta})g(θ)g(\theta) 的无偏估计。

一个经典的例子是方差估计:

  • 可以证明,样本方差 S2=1n1i=1n(XiXˉ)2S^2 = \frac{1}{n-1}\sum_{i=1}^{n} (X_i - \bar{X})^2 是总体方差 σ2\sigma^2 的无偏估计。
  • 但是,样本标准差 S=S2S = \sqrt{S^2} 并不是总体标准差 σ\sigma 的无偏估计。因为 E(S)σE(S) \neq \sigma(通常 E(S)<σE(S) < \sigma)。

这表明,在函数变换下,无偏性可能会丢失。

常用统计量及其性质

1. 样本均值

样本均值是最核心的统计量之一,定义为: Xˉ=1ni=1nXi\bar{X} = \frac{1}{n} \sum_{i=1}^{n} X_i

性质:设总体 XX 的期望为 μ\mu,方差为 σ2\sigma^2,则样本均值 Xˉ\bar{X} 具有以下性质:

  1. 期望E(Xˉ)=μE(\bar{X}) = \mu。这表明 Xˉ\bar{X}μ\mu无偏估计
  2. 方差Var(Xˉ)=σ2n\operatorname{Var}(\bar{X}) = \frac{\sigma^2}{n}

统计学意义

  • 无偏性保证了用 Xˉ\bar{X} 估计 μ\mu 没有系统性错误。
  • 方差 σ2/n\sigma^2/n 衡量了估计的精度。方差越小,估计值 Xˉ\bar{X} 的波动越小,估计越“稳定”。注意到方差与样本量 nn 成反比,这意味着增大样本量可以有效提高估计的精度。这也解释了为什么用单个样本 X1X_1 去估计 μ\mu(虽然也无偏,但方差为 σ2\sigma^2)远不如用样本均值 Xˉ\bar{X} 有效。

2. 样本方差与样本标准差

样本方差通常定义为: S2=1n1i=1n(XiXˉ)2S^2 = \frac{1}{n-1} \sum_{i=1}^{n} (X_i - \bar{X})^2 样本标准差则为: S=S2S = \sqrt{S^2}

为什么分母是 n1n-1 而不是 nn 关键在于无偏性。可以证明: E(S2)=σ2E(S^2) = \sigma^2S2S^2 是总体方差 σ2\sigma^2无偏估计。如果定义 S2=1ni=1n(XiXˉ)2S’^2 = \frac{1}{n} \sum_{i=1}^{n} (X_i - \bar{X})^2,则 E(S2)=n1nσ2σ2E(S’^2) = \frac{n-1}{n}\sigma^2 \neq \sigma^2,它是有偏的,但它是渐进无偏的。分母 n1n-1 在统计学中称为自由度

重要提醒SSσ\sigma 的有偏估计,这是无偏性不具有不变性的体现。

3. 样本矩

矩是描述分布特征的重要工具。我们可以定义样本的矩来对应总体的矩。

  • kk 阶样本原点矩Ak=1ni=1nXikA_k = \frac{1}{n} \sum_{i=1}^{n} X_i^k 它用于估计总体的 kk 阶原点矩 E(Xk)E(X^k)
  • kk 阶样本中心矩Mk=1ni=1n(XiXˉ)kM_k = \frac{1}{n} \sum_{i=1}^{n} (X_i - \bar{X})^k 它用于估计总体的 kk 阶中心矩 E[(Xμ)k]E[(X - \mu)^k]

矩估计法思想:矩估计法的核心思想就基于此:

  1. 用样本矩 AkA_k (或 MkM_k) 去估计总体矩 E(Xk)E(X^k) (或 E[(Xμ)k]E[(X-\mu)^k])。
  2. 若待估参数是总体矩的函数,则用样本矩的同一函数去估计它。

示例:对于伽马分布 XGamma(α,λ)X \sim \text{Gamma}(\alpha, \lambda),已知 E(X)=α/λE(X) = \alpha/\lambdaVar(X)=α/λ2\operatorname{Var}(X) = \alpha/\lambda^2

  • 用样本均值 Xˉ\bar{X} (即 A1A_1) 估计 E(X)E(X)Xˉα/λ\bar{X} \approx \alpha/\lambda
  • 用样本方差 S2S^2(注意 S2=nn1M2S^2 = \frac{n}{n-1} M_2,大样本下与样本二阶中心矩 M2M_2 近似相等)估计 Var(X)\operatorname{Var}(X)S2α/λ2S^2 \approx \alpha/\lambda^2
  • 联立两式,可解得参数 α\alphaλ\lambda 的矩估计: λ^=XˉS2,α^=Xˉλ^=Xˉ2S2\hat{\lambda} = \frac{\bar{X}}{S^2}, \quad \hat{\alpha} = \bar{X} \cdot \hat{\lambda} = \frac{\bar{X}^2}{S^2} 这里就体现了“用样本矩的函数估计总体矩的函数”的思想。

4. 样本偏度与样本峰度

这两个统计量用于刻画分布的形状。

  • 样本偏度βs=M3M23/2\beta_s = \frac{M_3}{M_2^{3/2}} 它刻画了分布的不对称性(偏斜方向与程度)。对于对称分布(如正态分布、t分布),理论偏度为0。βs>0\beta_s > 0 称为右偏(正偏),长尾在右;βs<0\beta_s < 0 称为左偏(负偏),长尾在左。
  • 样本峰度βk=M4M223\beta_k = \frac{M_4}{M_2^{2}} - 3 它刻画了分布尾部的厚度和峰态的尖峭程度。减去3是为了使标准正态分布的峰度为0。βk>0\beta_k > 0 称为尖峰肥尾(比正态分布更尖、尾巴更厚,如t分布);βk<0\beta_k < 0 称为平峰薄尾。

5. 次序统计量

将样本观测值 x1,x2,,xnx_1, x_2, \ldots, x_n 按从小到大的顺序排列,得到: x(1)x(2)x(n)x_{(1)} \le x_{(2)} \le \cdots \le x_{(n)} 对应的随机变量 X(1),X(2),,X(n)X_{(1)}, X_{(2)}, \ldots, X_{(n)} 称为次序统计量

其中特别重要的是:

  • 极小值X(1)=min{X1,,Xn}X_{(1)} = \min{X_1, \ldots, X_n}
  • 极大值X(n)=max{X1,,Xn}X_{(n)} = \max{X_1, \ldots, X_n}
  • 中位数X((n+1)/2)X_{(\lfloor (n+1)/2 \rfloor)} 或相邻两次序统计量的平均。

次序统计量在非参数统计和某些参数估计中非常有用。例如,对于均匀分布 U(a,b)U(a, b),很自然地会用 X(1)X_{(1)} 估计 aa,用 X(n)X_{(n)} 估计 bb

📝 动手练一练

  1. 统计量辨析:设 X1,X2,X3X_1, X_2, X_3 是来自总体 XX 的简单随机样本,总体均值 μ\mu 未知,总体方差 σ2=1\sigma^2 = 1 已知。判断下列哪些是统计量?如果是,它可能用于估计什么参数? a) Ta=X1+2X2X3T_a = X_1 + 2X_2 - X_3 b) Tb=13i=13(Xiμ)2T_b = \frac{1}{3}\sum_{i=1}^{3} (X_i - \mu)^2 c) Tc=max{X1,X2,X3}min{X1,X2,X3}2T_c = \frac{\max{X_1, X_2, X_3} - \min{X_1, X_2, X_3}}{2}

  2. 无偏性验证:使用 Python 模拟验证样本方差 S2S^2 的无偏性。从标准正态分布 N(0,1)N(0,1) 中重复抽取 n=10n=10 的样本 m=10000m=10000 次,每次计算样本方差 S2S^2,观察这 mmS2S^2 值的平均值是否接近总体方差 11。同时,计算 S2=1n(XiXˉ)2S’^2 = \frac{1}{n}\sum (X_i - \bar{X})^2 的平均值,观察其偏差。

参考答案

  1. a) TaT_a 是统计量(不含未知参数),它是样本的线性组合,但其期望为 2μ2\mu,若用于估计,需调整。 b) TbT_b 不是统计量,因为它包含了未知参数 μ\mu。 c) TcT_c 是统计量(极差的一半),它反映了样本的离散程度,可用于估计与总体范围或离散度相关的参数。

  2. 模拟验证代码如下:

    import numpy as np
    import scipy.stats as stats
    
    # 设置参数
    n = 10          # 样本量
    m = 10000       # 模拟次数
    true_variance = 1.0
    np.random.seed(2025)  # 固定随机种子,确保结果可复现
    
    # 存储结果
    s2_values = []
    s2_prime_values = []
    
    for _ in range(m):
        # 从标准正态分布中抽取 n 个样本
        sample = np.random.randn(n)
        sample_mean = np.mean(sample)
        # 计算 S^2 (无偏估计)
        s2 = np.sum((sample - sample_mean)**2) / (n - 1)
        # 计算 S'^2 (有偏估计)
        s2_prime = np.sum((sample - sample_mean)**2) / n
        s2_values.append(s2)
        s2_prime_values.append(s2_prime)
    
    # 计算平均值
    mean_s2 = np.mean(s2_values)
    mean_s2_prime = np.mean(s2_prime_values)
    
    print(f"总体方差 σ² = {true_variance}")
    print(f"无偏样本方差 S² 的均值 (模拟{m}次): {mean_s2:.4f}")
    print(f"有偏样本方差 S'² 的均值 (模拟{m}次): {mean_s2_prime:.4f}")
    print(f"理论期望 E(S'²) = {(n-1)/n * true_variance} = {((n-1)/n * true_variance):.4f}")

    运行上述代码,你将看到 mean_s2 非常接近 1,而 mean_s2_prime 则接近 0.9,验证了 S2S^2 的无偏性和 S2S’^2 的有偏性。

本章小结

本节我们深入探讨了统计推断的基石——统计量与抽样分布。

要点回顾

  • 统计量是不含未知参数的样本函数,它是压缩样本信息、进行统计推断的核心工具。
  • 估计量是用于参数估计的统计量,无偏性E(θ^)=θE(\hat{\theta}) = \theta)是衡量其优劣的基本准则。
  • 常用统计量构成了描述数据特征的工具箱:
    • 样本均值 Xˉ\bar{X}:估计总体均值 μ\mu,无偏,方差为 σ2/n\sigma^2/n
    • 样本方差 S2S^2:估计总体方差 σ2\sigma^2,无偏(分母为 n1n-1)。
    • 样本矩:矩估计法的基础。
    • 样本偏度 βs\beta_s 与峰度 βk\beta_k:刻画分布的形状特征。
    • 次序统计量:基于数据排序的统计量,如中位数、极差。

行动清单

  1. 强化概念:面对一组数据,尝试用本节学到的不同统计量(均值、方差、偏度等)来描述它,并思考每个统计量背后的统计学含义。
  2. 动手验证:使用 Python 的 numpyscipy.stats 模块,对你感兴趣的分布(如正态、指数、均匀分布)进行抽样模拟,计算样本统计量,并与总体理论值比较,直观感受无偏性、大数定律等概念。
  3. 预习思考:统计量是随机变量,那么它的分布(抽样分布)是怎样的?例如,样本均值 Xˉ\bar{X} 具体服从什么分布?这将是下一节的重点。

— 小象教研组

配套学习资源与课件
  • 第1章课件:统计量与抽样分布(PPT · 6.0MB)
    下载
🎁 免费学习资源

领取《小象 11GB VIP 课件资料包与大厂真题手册》

包含全套实战 Jupyter 源码、清洗后数据集、大厂高频面试真题与专属学员答疑交流群。

  • 完整 Python / 数据分析 Jupyter 实战源码
  • 大厂真实业务数据集与练习题
  • 微信扫码添加课程顾问,免费获取网盘下载链接
微信二维码:扫码添加课程顾问微信扫码添加顾问