📑 查看全课大纲(第 2 / 41 节)
- 1.数理统计中的基本概念
- 2.统计量与抽样分布(一)
- 3.统计量与抽样分布(二)
- 4.次序统计量
- 5.充分统计量与完备统计量
- 6.统计中常用分布族(一)
- 7.统计中常用分布族(二)
- 8.矩估计
- 9.极大似然估计
- 10.无偏估计与一致最小方差无偏估计(一)
- 11.无偏估计与一致最小方差无偏估计(二)
- 12.完备统计量
- 13.CR不等式及有效估计
- 14.相合估计
- 15.置信区间
- 16.正态总体参数的置信区间
- 17.大样本置信区间
- 18.Fisher显著性检验
- 19.正态总体参数的假设检验(一)
- 20.正态总体参数的假设检验(二)
- 21.似然比检验
- 22.Neyman-Pearson基本引理
- 23.一致最优势检验
- 24.无偏检验与一致最优势无偏检验
- 25.正态概率纸检验
- 26.拟合优度检验
- 27.列联表的独立性检验
- 28.Kolmogorov检验
- 29.正态性检验
- 30.Bayes统计
- 31.先验分布的确定
- 32.Bayes统计推断
- 33.统计判决理论
- 34.Minimax准则
- 35.非参数统计
- 36.符号检验
- 37.Wilcoxon符号秩检验
- 38.抽样调查
- 39.简单随机抽样
- 40.分层随机抽样
- 41.整群随机抽样
统计量与抽样分布(一)
约 56 分钟
统计量与抽样分布
小象实战讲义 · 数据科学的统计基础
在上一节我们建立了从总体到样本的基本框架。然而,原始样本数据往往杂乱无章,直接用于推断总体效率低下。本节我们将学习统计学的核心工具——统计量。它是样本信息的压缩与提炼,是连接样本与总体的桥梁。通过学习统计量的定义、性质以及其分布(抽样分布),你将掌握构建后续参数估计与假设检验理论的基础,并理解为何样本均值、样本方差等是我们最常用的统计推断工具。
💡 核心导读
- 统计量的本质:不含任何未知参数的样本函数。它既是随机变量(抽样前),也是确定的数值(抽样后)。
- 统计量的核心地位:统计推断的本质,就是通过构造合适的统计量,对样本信息进行压缩,进而推断总体特征。
- 估计量与无偏性:用于估计未知参数的统计量称为估计量。无偏性是衡量估计量优劣的首要准则,它意味着估计量在平均意义下等于待估参数。
- 常用统计量家族:样本均值、样本方差、样本矩、样本偏度与峰度、次序统计量等,它们各自承担着描述数据不同特征(位置、离散度、形态)的使命。
- 矩估计思想初探:用样本矩估计总体矩,是参数估计中矩估计法的核心思想,为我们提供了一种直观的参数估计方法。
统计量的定义与理解
从简单随机样本出发
设 是来自总体 的一个简单随机样本。这意味着:
- 独立性: 相互独立。
- 同分布性: 与总体 服从相同的分布。
简记为 。简单随机样本是统计推断中最基本、最重要的样本类型,它保证了样本能较好地代表总体,并且具有许多优良的数学性质。
统计量的正式定义
设 是样本 的一个 元函数。若 不包含任何关于总体的未知参数,则称 为一个统计量。
更简洁地说:不含任何未知参数的样本函数称为统计量。
理解统计量的两重性:
- 抽样前:由于样本 是随机变量,因此统计量 也是随机变量。它拥有自己的概率分布,这个分布被称为抽样分布。
- 抽样后:当我们获得一组具体的样本观测值 后,代入统计量 ,就能得到一个确定的数值 。这个数值就是统计量的一次实现。
示例辨析:设从总体 中抽取样本 ,其中 未知。判断下列哪些是统计量:
- ,其中
- ,其中
参考答案:
- 是统计量。它们都是样本的函数,且不包含未知参数 或 。
- 不是统计量。因为它们包含了未知的总体参数 和 。
统计量在统计推断中的核心作用
回顾统计学的任务:从总体中抽样,通过样本推断总体。统计量正是完成这一任务的关键枢纽。
- 信息压缩:原始样本 包含 个数据点,信息冗余且杂乱。统计量 对其进行了压缩和提炼,提取出关于总体特征(如均值、方差)的关键信息。
- 推断的载体:无论是参数估计(用统计量估计参数)还是假设检验(构造检验统计量),其核心步骤都是构造并使用合适的统计量。
估计量与无偏性
估计量:统计量的特化
如果一个统计量 被专门用来估计某个未知参数 ,那么我们就称 为参数 的一个估计量,通常记作 。
类似地,用于假设检验的统计量称为检验统计量。因此,估计量是服务于参数估计这一特定目的的统计量。
我们关心的参数 通常有三类:
- 分布中的未知参数:如正态分布的均值 和方差 ,泊松分布的参数 等。知道了它们,就完全确定了分布。
- 分布的数字特征:如总体的期望 、方差 、标准差、分位数等。它们通常是未知参数的函数。
- 某事件的概率:如产品合格率 。
无偏性:优良估计的基本要求
既然估计量 是随机变量,我们自然关心它的性质。最首要的性质是无偏性。
定义:设 是参数 的一个估计量,若对于参数空间 中的任意 ,都有 成立,则称 是 的一个无偏估计。否则,称为有偏估计。
直观理解:无偏性意味着,虽然一次估计的结果可能偏高或偏低,但如果我们进行大量重复抽样并计算估计量,这些估计值的平均值会等于参数的真值。这保证了估计量没有系统性的偏差。
渐进无偏:若估计量 (下标 强调其依赖于样本量)不满足无偏性,但当样本量 时,有 ,则称 是 的渐进无偏估计。
无偏性的一个重要性质:不具有不变性
无偏性是一个很好的性质,但它不具有不变性。即:如果 是 的无偏估计,并不能推出 是 的无偏估计。
一个经典的例子是方差估计:
- 可以证明,样本方差 是总体方差 的无偏估计。
- 但是,样本标准差 并不是总体标准差 的无偏估计。因为 (通常 )。
这表明,在函数变换下,无偏性可能会丢失。
常用统计量及其性质
1. 样本均值
样本均值是最核心的统计量之一,定义为:
性质:设总体 的期望为 ,方差为 ,则样本均值 具有以下性质:
- 期望:。这表明 是 的无偏估计。
- 方差:。
统计学意义:
- 无偏性保证了用 估计 没有系统性错误。
- 方差 衡量了估计的精度。方差越小,估计值 的波动越小,估计越“稳定”。注意到方差与样本量 成反比,这意味着增大样本量可以有效提高估计的精度。这也解释了为什么用单个样本 去估计 (虽然也无偏,但方差为 )远不如用样本均值 有效。
2. 样本方差与样本标准差
样本方差通常定义为: 样本标准差则为:
为什么分母是 而不是 ? 关键在于无偏性。可以证明: 即 是总体方差 的无偏估计。如果定义 ,则 ,它是有偏的,但它是渐进无偏的。分母 在统计学中称为自由度。
重要提醒: 是 的有偏估计,这是无偏性不具有不变性的体现。
3. 样本矩
矩是描述分布特征的重要工具。我们可以定义样本的矩来对应总体的矩。
- 阶样本原点矩: 它用于估计总体的 阶原点矩 。
- 阶样本中心矩: 它用于估计总体的 阶中心矩 。
矩估计法思想:矩估计法的核心思想就基于此:
- 用样本矩 (或 ) 去估计总体矩 (或 )。
- 若待估参数是总体矩的函数,则用样本矩的同一函数去估计它。
示例:对于伽马分布 ,已知 , 。
- 用样本均值 (即 ) 估计 :。
- 用样本方差 (注意 ,大样本下与样本二阶中心矩 近似相等)估计 :。
- 联立两式,可解得参数 和 的矩估计: 这里就体现了“用样本矩的函数估计总体矩的函数”的思想。
4. 样本偏度与样本峰度
这两个统计量用于刻画分布的形状。
- 样本偏度: 它刻画了分布的不对称性(偏斜方向与程度)。对于对称分布(如正态分布、t分布),理论偏度为0。 称为右偏(正偏),长尾在右; 称为左偏(负偏),长尾在左。
- 样本峰度: 它刻画了分布尾部的厚度和峰态的尖峭程度。减去3是为了使标准正态分布的峰度为0。 称为尖峰肥尾(比正态分布更尖、尾巴更厚,如t分布); 称为平峰薄尾。
5. 次序统计量
将样本观测值 按从小到大的顺序排列,得到: 对应的随机变量 称为次序统计量。
其中特别重要的是:
- 极小值:
- 极大值:
- 中位数: 或相邻两次序统计量的平均。
次序统计量在非参数统计和某些参数估计中非常有用。例如,对于均匀分布 ,很自然地会用 估计 ,用 估计 。
📝 动手练一练
统计量辨析:设 是来自总体 的简单随机样本,总体均值 未知,总体方差 已知。判断下列哪些是统计量?如果是,它可能用于估计什么参数? a) b) c)
无偏性验证:使用 Python 模拟验证样本方差 的无偏性。从标准正态分布 中重复抽取 的样本 次,每次计算样本方差 ,观察这 个 值的平均值是否接近总体方差 。同时,计算 的平均值,观察其偏差。
参考答案:
a) 是统计量(不含未知参数),它是样本的线性组合,但其期望为 ,若用于估计,需调整。 b) 不是统计量,因为它包含了未知参数 。 c) 是统计量(极差的一半),它反映了样本的离散程度,可用于估计与总体范围或离散度相关的参数。
模拟验证代码如下:
import numpy as np import scipy.stats as stats # 设置参数 n = 10 # 样本量 m = 10000 # 模拟次数 true_variance = 1.0 np.random.seed(2025) # 固定随机种子,确保结果可复现 # 存储结果 s2_values = [] s2_prime_values = [] for _ in range(m): # 从标准正态分布中抽取 n 个样本 sample = np.random.randn(n) sample_mean = np.mean(sample) # 计算 S^2 (无偏估计) s2 = np.sum((sample - sample_mean)**2) / (n - 1) # 计算 S'^2 (有偏估计) s2_prime = np.sum((sample - sample_mean)**2) / n s2_values.append(s2) s2_prime_values.append(s2_prime) # 计算平均值 mean_s2 = np.mean(s2_values) mean_s2_prime = np.mean(s2_prime_values) print(f"总体方差 σ² = {true_variance}") print(f"无偏样本方差 S² 的均值 (模拟{m}次): {mean_s2:.4f}") print(f"有偏样本方差 S'² 的均值 (模拟{m}次): {mean_s2_prime:.4f}") print(f"理论期望 E(S'²) = {(n-1)/n * true_variance} = {((n-1)/n * true_variance):.4f}")运行上述代码,你将看到
mean_s2非常接近 1,而mean_s2_prime则接近 0.9,验证了 的无偏性和 的有偏性。
本章小结
本节我们深入探讨了统计推断的基石——统计量与抽样分布。
要点回顾:
- 统计量是不含未知参数的样本函数,它是压缩样本信息、进行统计推断的核心工具。
- 估计量是用于参数估计的统计量,无偏性()是衡量其优劣的基本准则。
- 常用统计量构成了描述数据特征的工具箱:
- 样本均值 :估计总体均值 ,无偏,方差为 。
- 样本方差 :估计总体方差 ,无偏(分母为 )。
- 样本矩:矩估计法的基础。
- 样本偏度 与峰度 :刻画分布的形状特征。
- 次序统计量:基于数据排序的统计量,如中位数、极差。
行动清单:
- 强化概念:面对一组数据,尝试用本节学到的不同统计量(均值、方差、偏度等)来描述它,并思考每个统计量背后的统计学含义。
- 动手验证:使用 Python 的
numpy和scipy.stats模块,对你感兴趣的分布(如正态、指数、均匀分布)进行抽样模拟,计算样本统计量,并与总体理论值比较,直观感受无偏性、大数定律等概念。 - 预习思考:统计量是随机变量,那么它的分布(抽样分布)是怎样的?例如,样本均值 具体服从什么分布?这将是下一节的重点。
— 小象教研组
- 第1章课件:统计量与抽样分布(PPT · 6.0MB)下载
领取《小象 11GB VIP 课件资料包与大厂真题手册》
包含全套实战 Jupyter 源码、清洗后数据集、大厂高频面试真题与专属学员答疑交流群。
- ✔完整 Python / 数据分析 Jupyter 实战源码
- ✔大厂真实业务数据集与练习题
- ✔微信扫码添加课程顾问,免费获取网盘下载链接
微信扫码添加顾问