← 返回《数据科学的统计基础》
📑 查看全课大纲(第 39 / 41 节)

简单随机抽样

约 23 分钟

📺 正在播放小象官方高清录播(支持倍速与清晰度调节)

简单随机抽样

小象实战讲义 · 数据科学的统计基础

在数据科学实践中,我们常常无法对研究对象的全体(总体)进行调查,而是通过抽取一部分(样本)来推断总体特征。本节将介绍最简单、最基础的抽样方法——简单随机抽样。学完本节,你将掌握其核心定义、两种主要形式(重复与不重复抽样),并学会如何基于简单随机样本对总体均值和总量进行点估计与区间估计,以及如何科学地确定所需的样本量。

💡 核心导读

  • 定义与分类:理解简单随机抽样的核心是“等概率抽取”,并区分重复抽样(放回)与不重复抽样(不放回)两种方式及其性质。
  • 样本性质:掌握重复抽样下样本的独立同分布(i.i.d.)性质,以及不重复抽样下样本的概率计算。
  • 估计方法:学习如何用样本均值估计总体均值,用样本均值乘以总体单元数估计总体总量,并计算其标准误差。
  • 区间估计与误差控制:掌握在给定置信水平下,构建总体参数置信区间的方法,理解“误差线”的实际意义。
  • 样本量确定:学会在给定精度(误差线)和置信水平的要求下,反推所需的最小样本量,这是科学抽样设计的核心。

基本概念与分类

简单随机抽样是一种最基础的抽样方法。它是指从容量为 NN 的有限总体中,随机地抽取 nn 个单元组成样本,并且每个样本被抽中的概率相同。这是随机抽样的核心原则。

根据抽样过程中是否将已抽中的单元放回总体,简单随机抽样可分为两类:

  1. 重复抽样(放回抽样):每次从总体中抽取一个单元,观测记录后放回总体,然后再抽取下一个单元,直到抽满 nn 个单元为止。这样,同一个单元有可能被多次抽中。
  2. 不重复抽样(不放回抽样):每次从总体中抽取一个单元,观测记录后不再放回总体,再从剩下的单元中抽取下一个,直到抽满 nn 个单元为止。每个单元最多只能被抽中一次。

在实际调查中,由于不重复抽样避免了信息的重复(同一个个体被调查多次通常不提供额外信息),因此一般情况下进行的都是不重复抽样。重复抽样因其理论性质优良(样本独立同分布),常作为理论分析的基础。

重复抽样的性质与概率

在重复简单随机抽样下,设总体有 NN 个单元,每次抽取时每个单元被抽中的概率均为 1/N1/N。记第 ii 次抽取的随机变量为 XiX_i

此时,所获得的样本 (X1,X2,,Xn)(X_1, X_2, \dots, X_n) 具有两个重要特性:

  • 代表性:每个 XiX_i 与总体 XX 具有相同的概率分布。
  • 独立性X1,X2,,XnX_1, X_2, \dots, X_n 相互独立。

因此,重复简单随机抽样得到的样本是独立同分布(i.i.d.) 的随机样本。

对于一组特定的观测结果 (x1,x2,,xn)(x_1, x_2, \dots, x_n),由于每次抽取独立且概率相等,则抽到该特定样本的概率为: P(X1=x1,X2=x2,,Xn=xn)=i=1nP(Xi=xi)=(1N)nP(X_1=x_1, X_2=x_2, \dots, X_n=x_n) = \prod_{i=1}^{n} P(X_i = x_i) = \left( \frac{1}{N} \right)^n

不重复抽样的性质与概率

在不重复简单随机抽样下,样本单元不再独立。从 NN 个单元中抽取 nn 个,所有可能的样本组合总数为组合数 CNnC_N^n。在“每个样本被抽中的概率相同”的原则下,任意一个特定样本被抽中的概率为 1/CNn1 / C_N^n

对于一组特定的观测结果 (x1,x2,,xn)(x_1, x_2, \dots, x_n),其被抽中的概率可以通过乘法原理计算:第一次抽中 x1x_1 的概率是 1/N1/N,第二次从剩余 N1N-1 个中抽中 x2x_2 的概率是 1/(N1)1/(N-1),依此类推。因此: P(X1=x1,X2=x2,,Xn=xn)=1N×1N1××1Nn+1=(Nn)!N!P(X_1=x_1, X_2=x_2, \dots, X_n=x_n) = \frac{1}{N} \times \frac{1}{N-1} \times \cdots \times \frac{1}{N-n+1} = \frac{(N-n)!}{N!} 注意上式是考虑抽取顺序的特定有序序列的概率;若不考虑顺序,L42 中特定无序样本组合的概率为 1CNn=n!(Nn)!N!\frac{1}{C_N^n} = \frac{n!(N-n)!}{N!},是上式的 n!n! 倍(同一个组合对应 n!n! 种排列顺序)。两者相差因子 n!n!,并非同一个量。

重要近似:当总体容量 NN 很大,而抽样比 n/Nn/N 很小时,不重复抽样与重复抽样的结果非常接近。因此,在大样本情况下,常不严格区分两者,并利用重复抽样的理论性质进行近似分析。

基于简单随机样本的估计

抽样不是目的,目的是通过样本估计总体参数。在进行估计时,通常需考虑三个问题:1) 估计量的构造;2) 估计量优良性的评判准则;3) 估计量的误差范围。前两个问题在点估计章节已有详述,本节重点结合抽样场景应用并关注误差控制。

总体均值的估计

设总体均值为 μ\mu,总体方差为 σ2\sigma^2。在简单随机抽样(特别是重复抽样近似)下,我们自然地用样本均值 Xˉ\bar{X} 作为 μ\mu 的估计量。 μ^=Xˉ=1ni=1nXi\hat{\mu} = \bar{X} = \frac{1}{n} \sum_{i=1}^{n} X_i 该估计量是无偏的,即 E(Xˉ)=μE(\bar{X}) = \mu

其方差(即估计的精度)为: Var(Xˉ)=σ2n\text{Var}(\bar{X}) = \frac{\sigma^2}{n} 标准误差为 σ/n\sigma / \sqrt{n}。在实际计算中,总体方差 σ2\sigma^2 未知,常用样本方差 S2S^2 替代。

区间估计:根据中心极限定理,在大样本情况下,Xˉ\bar{X} 近似服从正态分布。因此,总体均值 μ\mu1α1-\alpha 置信区间为: xˉ±zα/2σnxˉ±zα/2sn(当 σ 未知时)\bar{x} \pm z_{\alpha/2} \cdot \frac{\sigma}{\sqrt{n}} \quad \text{或} \quad \bar{x} \pm z_{\alpha/2} \cdot \frac{s}{\sqrt{n}} \quad (\text{当 }\sigma \text{ 未知时}) 其中,zα/2z_{\alpha/2} 是标准正态分布的上 α/2\alpha/2 分位数,xˉ\bar{x}ss 是样本观测值。区间的半宽 zα/2σnz_{\alpha/2} \cdot \frac{\sigma}{\sqrt{n}} 被称为误差线或极限误差,记为 Δ\Delta。它表示在给定置信水平下,估计值与真值之间可能的最大绝对误差。

总体总量的估计

有时我们更关心总体总量 TT,例如一个城市的总用水量、一批产品的总重量。若总体单元总数 NN 已知,则总体总量 T=NμT = N\mu。很自然地,我们用 NXˉN\bar{X} 来估计 TTT^=NXˉ\hat{T} = N\bar{X} 该估计量也是无偏的。其方差和标准误差为: Var(T^)=N2Var(Xˉ)=N2σ2n,SE(T^)=Nσn\text{Var}(\hat{T}) = N^2 \cdot \text{Var}(\bar{X}) = N^2 \cdot \frac{\sigma^2}{n}, \quad \text{SE}(\hat{T}) = N \cdot \frac{\sigma}{\sqrt{n}} 相应地,总体总量 TT1α1-\alpha 置信区间为: Nxˉ±zα/2NσnN\bar{x} \pm z_{\alpha/2} \cdot N \cdot \frac{\sigma}{\sqrt{n}} 其误差线为 ΔT=NΔ\Delta_T = N \cdot \Delta

样本量的确定

科学抽样的一个核心优势是,可以通过调整样本量 nn 来控制估计的精度。给定置信水平 1α1-\alpha 和允许的误差线 Δ\Delta,我们可以反推出所需的最小样本量。

对于总体均值的估计,由误差线公式 Δ=zα/2σn\Delta = z_{\alpha/2} \cdot \frac{\sigma}{\sqrt{n}} 可解出: n=(zα/2σΔ)2n = \left( \frac{z_{\alpha/2} \cdot \sigma}{\Delta} \right)^2 这里 σ\sigma 通常是未知的,在实际操作中,可以用历史的、预调查的或保守估计的方差值 S2S^2 来代替 σ2\sigma^2

import numpy as np
from scipy import stats

# 示例:根据精度要求确定样本量
# 已知某产品质量测量的历史标准差 sigma = 2.5 克
# 要求以95%的置信水平,使估计均值的误差不超过 0.8 克
sigma = 2.5
delta = 0.8
confidence = 0.95
alpha = 1 - confidence

# 计算标准正态分布的临界值
z_critical = stats.norm.ppf(1 - alpha/2)

# 计算所需样本量(向上取整)
n_required = np.ceil((z_critical * sigma / delta) ** 2)
print(f"在{confidence*100:.0f}%置信水平下,")
print(f"为将误差控制在 ±{delta} 克以内,至少需要样本量: n = {int(n_required)}")

# 验证:模拟抽样,计算实际误差
np.random.seed(42) # 固定随机种子以便复现
true_mean = 500 # 假设真实总体均值 500克
# 按计算出的样本量进行模拟抽样
sample = np.random.normal(loc=true_mean, scale=sigma, size=int(n_required))
sample_mean = np.mean(sample)
margin_of_error = z_critical * sigma / np.sqrt(n_required)
print(f"\n模拟抽样结果:")
print(f"  样本均值: {sample_mean:.2f} 克")
print(f"  估计的95%%置信区间: ({sample_mean - margin_of_error:.2f}, {sample_mean + margin_of_error:.2f})")
print(f"  区间宽度: {2 * margin_of_error:.2f} 克 (目标:≤ {2*delta:.2f} 克)")

📝 动手练一练

  1. 误差线理解:某品牌食盐包装上标注“净含量:500克 ± 5克”。从统计学的抽样估计角度,你如何理解这个“±5克”?它与本节所学的“误差线”有何联系与区别?

  2. 样本量计算:一项关于居民每日屏幕使用时间的预调查显示,样本标准差约为120分钟。若研究者希望以95%的置信水平,将总体平均屏幕使用时间的估计误差控制在20分钟以内,请问至少需要调查多少位居民?(使用 scipy.stats.norm.ppf 计算临界值)

参考答案:

  1. 包装上的“±5克”可以类比为在某种质量保证(类似置信水平)下的允许误差范围,即误差线。区别在于,产品标注的误差范围通常基于生产工艺和控制标准,是预先设定的允许公差;而统计学的误差线 Δ\Delta 是基于抽样分布和概率计算出来的,它明确关联了一个置信水平,表示估计值落在这个区间内的概率。
  2. 根据公式 n=(zα/2σ/Δ)2n = (z_{\alpha/2} \cdot \sigma / \Delta)^2 计算。z0.0251.96z_{0.025} \approx 1.96, σ=120\sigma=120, Δ=20\Delta=20。代入得 n=(1.96120/20)2=(11.76)2138.3n = (1.96 * 120 / 20)^2 = (11.76)^2 \approx 138.3。因此,至少需要调查 139 位居民。

本章小结

本节深入探讨了抽样调查的基石——简单随机抽样。我们从其等概率的核心定义出发,区分了重复与不重复抽样,并重点学习了如何基于简单随机样本对总体进行统计推断。

要点回顾

  • 简单随机抽样的关键是保证每个样本被抽中的概率相同。
  • 重复抽样产生独立同分布样本,理论性质优良;不重复抽样更常用,当总体很大时两者近似。
  • 用样本均值 Xˉ\bar{X} 估计总体均值 μ\mu,用 NXˉN\bar{X} 估计总体总量 TT,它们都是无偏估计。
  • 区间估计提供了参数可能存在的范围,其半宽即误差线 Δ\Delta,直观反映了估计精度。
  • 可以通过公式 n=(zα/2σ/Δ)2n = (z_{\alpha/2} \cdot \sigma / \Delta)^2 在设定精度和置信水平后,科学确定所需的最小样本量。

行动清单

  1. 明确抽样方式:在设计任何数据收集方案时,首先思考并明确你将采用重复还是不重复抽样,并理解其对后续分析的影响。
  2. 计算与报告误差:在汇报任何基于抽样的估计结果(如平均得分、平均用时)时,养成同时报告其标准误差或置信区间的习惯,而不仅仅是点估计值。
  3. 预先进行样本量估算:在启动一项调查或实验前,利用历史数据或预调查,根据可接受的误差范围和置信水平,估算所需的样本量,使研究设计更加科学、经济。

— 小象教研组

配套学习资源与课件
  • 第8章课件:抽样调查(PDF · 7.7MB)
    下载
🎁 免费学习资源

领取《小象 11GB VIP 课件资料包与大厂真题手册》

包含全套实战 Jupyter 源码、清洗后数据集、大厂高频面试真题与专属学员答疑交流群。

  • 完整 Python / 数据分析 Jupyter 实战源码
  • 大厂真实业务数据集与练习题
  • 微信扫码添加课程顾问,免费获取网盘下载链接
微信二维码:扫码添加课程顾问微信扫码添加顾问