← 返回《数据科学的统计基础》
📑 查看全课大纲(第 1 / 41 节)

数理统计中的基本概念

约 53 分钟

📺 正在播放小象官方高清录播(支持倍速与清晰度调节)

数理统计中的基本概念

小象实战讲义 · 数据科学的统计基础

欢迎来到《数据科学的统计基础》第一讲!在开始学习具体的统计方法之前,我们必须先建立一套共同的语言。本节将为你奠定数理统计的基石,清晰定义“总体”、“样本”、“统计量”等核心概念。学完本节,你将能够准确描述一个统计问题的构成要素,理解从总体到样本再到统计推断的完整逻辑链条,并掌握用图表初步探索数据分布的基本方法。

💡 核心导读

本节你将学到:

  1. 统计问题的基本框架:理解从总体抽样,到构造统计量,再到统计推断的完整流程。
  2. 核心概念的定义:清晰区分总体、个体、样本、简单随机样本、参数与参数空间。
  3. 数据的初步探索:掌握茎叶图、直方图等图表方法,直观认识数据背后的分布规律。
  4. 样本的数学描述:学习简单随机样本的联合分布,为后续的参数估计(如极大似然估计)打下基础。

从实际问题到统计框架

我们通过一个环保监测的例子,来感受一个典型的统计问题是如何被提出的:

某地环保法规定,排入河流的废水中某种有害物质的含量不得超过3个单位。环保组织连续20天对该厂废水进行测量,得到20个观测值 x1,x2,,x20x_1, x_2, \dots, x_{20}

基于这些数据,我们关心三个问题:

  1. 有害物质含量 XX 的分布是否为正态分布?(分布检验
  2. 若服从正态分布,如何估计其均值 aa 和方差 σ2\sigma^2?(参数估计
  3. 该厂废水是否符合规定,即均值 aa 是否小于等于3?(假设检验

这三个问题恰好对应了数理统计中最核心的三大类方法。解决它们的通用流程可以概括为下图所示的“统计三部曲”:

[总体] -> [抽样] -> [样本] -> [信息压缩] -> [统计量] -> [统计推断]

第一步:抽样。从我们感兴趣的研究对象全体(总体)中,抽取一部分个体进行观测,得到样本

第二步:信息压缩。原始的样本数据往往杂乱无章。我们需要从中提取有用信息,构造出统计量(如样本均值 Xˉ\bar{X}、样本方差 S2S^2)。统计量是对样本信息的高度概括和压缩。

第三步:统计推断。基于构造出的统计量,对总体进行推断。推断主要分为两类:参数估计(估计总体未知参数)和假设检验(对关于总体的某个命题做出判断)。

这个流程揭示了统计学的本质:一门归纳的学科。它从部分(样本)出发,去推断整体(总体)的性质。这与概率论的演绎逻辑(从公理出发进行推理)相辅相成,共同构成了统计学的理论基础。

总体、个体与样本

总体与个体

在一个统计问题中,我们把研究对象的全体构成的集合称为总体。总体中的每一个元素称为个体

关键理解:总体和个体的具体所指,会随着研究问题的维度而变化。

  • 研究“全校男生的平均身高”:总体是全校男生的身高,个体是每个男生的身高
  • 研究“全校男生的平均体重”:总体就变成了全校男生的体重,个体是每个男生的体重

虽然研究对象是同一群人,但关注的属性(维度)不同,总体和个体的定义也随之改变。通常,我们关注的是个体的某个数量指标,将其视为一个随机变量 XX,而总体则对应着 XX 的概率分布。

样本与抽样

研究总体有两种方式:普查(调查全部个体)和抽样(调查部分个体)。统计学更关注经济、高效的抽样方法。

从总体中抽取的部分个体组成的集合称为样本。样本中所含个体的数目 nn 称为样本容量。样本通常用 nn 个随机变量 X1,X2,,XnX_1, X_2, \dots, X_n 表示,它们的一次具体观测值记为 x1,x2,,xnx_1, x_2, \dots, x_n

为了让样本能很好地代表总体,最理想的抽样方式是简单随机抽样,它满足:

  1. 随机性:总体中每个个体被抽中的机会均等。
  2. 独立性:每次抽取的结果不影响其他各次的抽取结果,各次抽取相互独立。

由简单随机抽样得到的样本 X1,X2,,XnX_1, X_2, \dots, X_n 称为简单随机样本。它具有极其重要的性质:独立同分布。即 X1,X2,,XnX_1, X_2, \dots, X_n 相互独立,且每个 XiX_i 都与总体 XX 服从相同的分布,简记为 Xii.i.d.F(x)X_i \stackrel{\text{i.i.d.}}{\sim} F(x)

样本的两重性

样本具有双重身份:

  • 随机性:在抽样之前,样本 X1,X2,,XnX_1, X_2, \dots, X_n 是一组随机变量。
  • 确定性:在一次具体的抽样观测之后,我们得到一组确定的数值 x1,x2,,xnx_1, x_2, \dots, x_n

在叙述中,我们通常用大写字母表示随机变量形式的样本,用小写字母表示其观测值(数据)。

认识数据:图表方法

样本承载着总体信息,但原始数据往往杂乱。图表法是进行数据整理和初步探索的直观工具。

茎叶图

茎叶图能同时展示数据的分布形状和保留原始数据信息。它将每个数据分成“茎”(高位数字)和“叶”(低位数字)两部分。 例如,某班31名学生成绩的茎叶图可能如下:

2 | 5
3 |
4 | 5
5 | 045
6 | 148
7 | 00122334456889
8 | 01234478
9 | 13

解读:“5 | 045”表示有三个成绩:50, 54, 55。“7 | 00122334456889”表示成绩在70-79分之间的具体分布。茎叶图的优点是直观且不损失数据细节,特别适合小样本。

直方图

直方图通过将数据取值区间分组,用矩形面积表示频数或频率,来展示数据的分布概况。

import numpy as np
import matplotlib.pyplot as plt

# 模拟生成一些学生成绩数据
np.random.seed(42)
# 假设成绩总体呈偏态分布
scores = np.random.beta(2, 5, 100) * 60 + 40  # 生成40-100分之间的偏态数据

# 绘制直方图
plt.figure(figsize=(8, 5))
plt.hist(scores, bins=12, edgecolor='black', alpha=0.7, color='skyblue')
plt.xlabel('考试成绩')
plt.ylabel('频数')
plt.title('100名学生考试成绩分布直方图')
plt.grid(True, linestyle='--', alpha=0.5)
plt.show()

直方图能清晰显示数据分布的中心位置、展布形状(对称、偏态)等特征,适用于大样本数据的初步观察,但会损失具体的个体数据值。

样本的联合分布与参数

简单随机样本的联合分布

对于简单随机样本 X1,X2,,Xni.i.d.F(x)X_1, X_2, \dots, X_n \stackrel{\text{i.i.d.}}{\sim} F(x),其联合分布函数和联合概率密度(或概率质量)函数因其独立性而变得简单。

设总体 XX 的分布函数为 F(x)F(x),概率密度函数为 f(x)f(x)(连续型)或概率质量函数为 P(X=x)P(X=x)(离散型),则样本的:

  • 联合分布函数F(x1,x2,,xn)=P(X1x1,X2x2,,Xnxn)=i=1nF(xi)F(x_1, x_2, \dots, x_n) = P(X_1 \le x_1, X_2 \le x_2, \dots, X_n \le x_n) = \prod_{i=1}^{n} F(x_i)
  • 联合概率密度函数(连续型): f(x1,x2,,xn)=i=1nf(xi)f(x_1, x_2, \dots, x_n) = \prod_{i=1}^{n} f(x_i)
  • 联合概率质量函数(离散型): P(X1=x1,X2=x2,,Xn=xn)=i=1nP(Xi=xi)P(X_1=x_1, X_2=x_2, \dots, X_n=x_n) = \prod_{i=1}^{n} P(X_i=x_i)

例1(测量问题):为估计某物体重量 aa,用天平进行 nn 次独立测量。设测量误差 ϵiN(0,σ2)\epsilon_i \sim N(0, \sigma^2),则测量结果 Xi=a+ϵiN(a,σ2)X_i = a + \epsilon_i \sim N(a, \sigma^2)。简单随机样本 X1,,XnX_1, \dots, X_n 的联合概率密度函数为: f(x1,,xn;a,σ2)=i=1n12πσ2exp((xia)22σ2)=(2πσ2)n/2exp(12σ2i=1n(xia)2)f(x_1, \dots, x_n; a, \sigma^2) = \prod_{i=1}^{n} \frac{1}{\sqrt{2\pi\sigma^2}} \exp\left(-\frac{(x_i - a)^2}{2\sigma^2}\right) = (2\pi\sigma^2)^{-n/2} \exp\left(-\frac{1}{2\sigma^2}\sum_{i=1}^{n}(x_i - a)^2\right)

例2(寿命问题):某电子元件寿命 XExp(λ)X \sim \text{Exp}(\lambda),即 f(x)=λeλx,x>0f(x) = \lambda e^{-\lambda x}, x>0。从中独立抽取 nn 件测得寿命 X1,,XnX_1, \dots, X_n,则联合概率密度函数为: f(x1,,xn;λ)=i=1nλeλxi=λnexp(λi=1nxi),xi>0f(x_1, \dots, x_n; \lambda) = \prod_{i=1}^{n} \lambda e^{-\lambda x_i} = \lambda^n \exp\left(-\lambda \sum_{i=1}^{n} x_i\right), \quad x_i > 0

参数空间与分布族

在上述例子中,分布由一些常数决定(如正态分布中的 aaσ2\sigma^2,指数分布中的 λ\lambda)。这些决定分布的常数称为参数,通常是未知的,记为 θ\theta

参数 θ\theta 所有可能取值的集合称为参数空间,记为 Θ\Theta

  • 对于测量模型 N(a,σ2)N(a, \sigma^2),参数 θ=(a,σ2)\theta = (a, \sigma^2),参数空间 Θ={(a,σ2):aR,σ2>0}\Theta = {(a, \sigma^2): a \in \mathbb{R}, \sigma^2 > 0}
  • 对于指数分布 Exp(λ)\text{Exp}(\lambda),参数 θ=λ\theta = \lambda,参数空间 Θ={λ:λ>0}\Theta = {\lambda: \lambda > 0}

给定一个分布形式(如正态分布),当参数 θ\theta 在参数空间 Θ\Theta 中变动时,就得到一族分布。所有这样的分布构成的集合称为一个分布族,可表示为 {F(x;θ):θΘ}{F(x; \theta): \theta \in \Theta}。 常见的分布族有:

  • 正态分布族:{N(a,σ2):aR,σ2>0}{N(a, \sigma^2): a \in \mathbb{R}, \sigma^2 > 0}
  • 指数分布族:{Exp(λ):λ>0}{\text{Exp}(\lambda): \lambda > 0}
  • 二项分布族:{B(n,p):p(0,1)}{B(n, p): p \in (0, 1)}(其中 nn 固定)

📝 动手练一练

  1. 概念辨析:在研究“本市所有智能手机用户的日均使用时长”时,请指出:

    • 总体是什么?
    • 个体是什么?
    • 若从全市随机抽取500名用户进行调查,得到的“500个日均使用时长数据”是总体、样本还是统计量?
  2. 联合分布计算:假设某种零件的直径(单位:mm)服从均匀分布 XU(θ0.5,θ+0.5)X \sim U(\theta - 0.5, \theta + 0.5),其中 θ\theta 是未知参数。现随机抽取3个零件进行测量,得到样本 X1,X2,X3X_1, X_2, X_3

    • 写出样本 X1,X2,X3X_1, X_2, X_3 的联合概率密度函数 f(x1,x2,x3;θ)f(x_1, x_2, x_3; \theta)
    • 该分布的参数空间 Θ\Theta 是什么?

参考答案:

    • 总体:本市所有智能手机用户的日均使用时长。
    • 个体:本市每一位智能手机用户的日均使用时长。
    • 这是样本(的观测值)。
    • 均匀分布的密度函数为 f(x;θ)=I(θ0.5<x<θ+0.5)f(x; \theta) = I(\theta - 0.5 < x < \theta + 0.5)。由于样本独立同分布,联合密度为: f(x1,x2,x3;θ)=i=13I(θ0.5<xi<θ+0.5)=I(θ0.5<x(1))I(x(3)<θ+0.5)f(x_1, x_2, x_3; \theta) = \prod_{i=1}^{3} I(\theta - 0.5 < x_i < \theta + 0.5) = I(\theta - 0.5 < x_{(1)}) \cdot I(x_{(3)} < \theta + 0.5) 其中 x(1)=min(x1,x2,x3)x_{(1)} = \min(x_1, x_2, x_3), x(3)=max(x1,x2,x3)x_{(3)} = \max(x_1, x_2, x_3)。该函数在条件满足时为1,否则为0。
    • 参数 θ\theta 可以是任何实数,故参数空间 Θ=R\Theta = \mathbb{R}

本章小结

本节我们搭建了数理统计最基础的概念框架:

  • 统计流程:明确了从总体抽样,到构造统计量,最后进行统计推断(参数估计与假设检验)的核心路径。
  • 核心概念:清晰定义了总体、个体、样本、简单随机样本(i.i.d.)、参数与参数空间,并理解了样本的随机与确定两重性。
  • 数据初探:掌握了茎叶图和直方图这两种直观的数据探索工具。
  • 数学基础:学习了简单随机样本的联合分布表示,这是后续许多统计方法(如极大似然估计)的起点。

行动清单 为了巩固本节知识,你可以立即做以下两件事:

  1. 观察生活:找一个你身边感兴趣的现象(如“室友每晚睡觉时间”),尝试用本节的概念描述它:总体是什么?如何获取一个简单随机样本?
  2. 动手绘图:使用 Python 的 matplotlib 库,为你手头的一组数据(至少20个数值)分别绘制茎叶图(可使用 stem 图或专门库)和直方图,并对比两者呈现信息的异同。

— 小象教研组

配套学习资源与课件
  • 第1章课件:统计量与抽样分布(PPT · 6.0MB)
    下载
🎁 免费学习资源

领取《小象 11GB VIP 课件资料包与大厂真题手册》

包含全套实战 Jupyter 源码、清洗后数据集、大厂高频面试真题与专属学员答疑交流群。

  • 完整 Python / 数据分析 Jupyter 实战源码
  • 大厂真实业务数据集与练习题
  • 微信扫码添加课程顾问,免费获取网盘下载链接
微信二维码:扫码添加课程顾问微信扫码添加顾问