← 返回《数据科学的统计基础》
📑 查看全课大纲(第 21 / 41 节)

似然比检验

约 27 分钟

📺 正在播放小象官方高清录播(支持倍速与清晰度调节)

似然比检验

小象实战讲义 · 数据科学的统计基础

在学习了显著性检验和正态总体参数的检验后,我们面临一个核心问题:对于更一般的假设检验问题(例如原假设是参数属于某个区间),如何系统性地构造检验统计量?本节介绍的似然比检验提供了一种统一且强大的框架。它基于极大似然估计的思想,能够处理任意分布族和任意形式的原假设,是实践中应用最广泛的检验方法之一。学完本节,你将掌握一种“万能”的检验构造工具,并能将其应用于正态与非正态总体的各类检验问题。

💡 核心导读

  • 为何需要似然比检验:回顾传统检验方法在构造统计量时的“经验性”与“非系统性”,引出对更一般化检验方法的需求。
  • 似然比统计量的定义与思想:理解“在原假设参数空间与全参数空间上最大化似然函数之比”的核心构造,并掌握其统计含义——比值越小,越倾向于拒绝原假设。
  • 似然比检验的步骤与优点:掌握从写出似然函数、求极值到构造拒绝域的标准流程,并理解其“统一构造方法”、“拒绝域方向明确”、“适用性广”三大优势。
  • 关键技巧:寻找单调统计量:学习当似然比统计量分布未知时,如何通过寻找其单调函数(如常见的 ttFF、卡方统计量)来等价地确定拒绝域。
  • 大样本理论:Wilks定理:了解在大样本下,2lnλ-2\ln\lambda 近似服从卡方分布的重要结论,这是许多拟合优度检验(如第五章的皮尔逊卡方检验)的理论基础。

从传统检验到一般化问题

在之前的章节中,无论是Fisher的显著性检验还是针对正态总体参数的检验,构造一个检验的核心在于两点:

  1. 推导出检验统计量 TT,并知道其在原假设 H0H_0 成立条件下的分布(即“零分布”)。
  2. 根据实际问题(H0H_0H1H_1 的形式)确定拒绝域 WW

其中,确定拒绝域 WW 的方向(如 T>c|T|>c 还是 T>cT>c)通常比较容易,但构造合适的检验统计量 TT 并推导其零分布则相对困难。以往的方法大多依赖于对参数估计量的直观构造(如用样本均值构造 UU 统计量,用样本方差构造 χ2\chi^2 统计量),这个过程缺乏系统性,更多地依赖经验和直觉

更重要的是,之前讨论的假设检验问题,其原假设大多是“特定点”或“单边”的形式,例如:

  • H0:μ=μ0H_0: \mu = \mu_0 vs H1:μμ0H_1: \mu \ne \mu_0
  • H0:μμ0H_0: \mu \le \mu_0 vs H1:μ>μ0H_1: \mu > \mu_0

然而,更一般的假设检验问题可以表述为: H0:θΘ0vsH1:θΘ1H_0: \theta \in \Theta_0 \quad \text{vs} \quad H_1: \theta \in \Theta_1 其中,Θ0\Theta_0Θ1\Theta_1 是参数空间 Θ\Theta 的两个不相交子集,且 Θ0Θ1=Θ\Theta_0 \cup \Theta_1 = \Theta。这里的 Θ0\Theta_0 可以是一个区间,例如 H0:θ1θθ2H_0: \theta_1 \le \theta \le \theta_2。对于这种一般形式的假设,传统的显著性检验方法很难直接确定其拒绝域。

似然比检验正是为了解决上述问题而提出的。它提供了一种统一的、系统化的方法来构造检验统计量,并且其拒绝域的方向是天然确定的。

似然比检验的原理与定义

似然比统计量

X1,X2,,XnX_1, X_2, \ldots, X_n 是来自分布族 {f(x;θ):θΘ}{f(x;\theta): \theta \in \Theta} 的独立同分布样本。考虑一般的假设检验问题: H0:θΘ0vsH1:θΘ1=ΘΘ0H_0: \theta \in \Theta_0 \quad \text{vs} \quad H_1: \theta \in \Theta_1 = \Theta - \Theta_0

似然比统计量 λ(x)\lambda(\mathbf{x}) 定义为: λ(x)=supθΘ0L(θ;x)supθΘL(θ;x)\lambda(\mathbf{x}) = \frac{\sup_{\theta \in \Theta_0} L(\theta; \mathbf{x})}{\sup_{\theta \in \Theta} L(\theta; \mathbf{x})} 其中 L(θ;x)=i=1nf(xi;θ)L(\theta; \mathbf{x}) = \prod_{i=1}^n f(x_i; \theta) 是样本的似然函数。

  • 分子:在原假设 H0H_0 所限制的参数区域 Θ0\Theta_0 上,似然函数所能达到的最大值。这可以理解为,在 H0H_0 的约束下,我们能为观测数据找到的“最佳解释”的似然度。
  • 分母:在整个参数空间 Θ\Theta 上,似然函数所能达到的最大值。这就是通常的(无约束)极大似然估计对应的似然度,是数据在所有可能参数下能得到的最“佳”解释。

显然,由于 Θ0Θ\Theta_0 \subseteq \Theta,分母的最大值至少不小于分子的最大值,因此总有 0λ(x)10 \le \lambda(\mathbf{x}) \le 1

似然比检验的思想

λ(x)\lambda(\mathbf{x}) 的值越小,意味着什么?

  • 分母(全空间最大似然)是固定的。
  • 分子(H0H_0 约束下最大似然)很小。
  • 这表明:在原假设 H0H_0 的框架下,我们观测到当前样本的可能性非常低。或者说,数据更支持那些不在 Θ0\Theta_0 中的参数值(即备择假设 H1H_1)。

因此,一个直观的检验法则是:当 λ(x)\lambda(\mathbf{x}) 小到一定程度时,我们就有理由拒绝原假设 H0H_0

似然比检验的定义

基于上述思想,我们定义水平为 α\alpha 的似然比检验: 其拒绝域为 W={x:λ(x)c}W = {\mathbf{x}: \lambda(\mathbf{x}) \le c} 其中临界值 cc (0c1)(0 \le c \le 1) 由下式确定,以控制第一类错误概率不超过 α\alphasupθΘ0Pθ(λ(X)c)α\sup_{\theta \in \Theta_0} P_\theta(\lambda(\mathbf{X}) \le c) \le \alpha

似然比检验的三大优点

  1. 假设形式一般化:可以处理 H0:θΘ0H_0: \theta \in \Theta_0 这种非常一般的假设形式。
  2. 检验统计量明确:直接给出了检验统计量 λ(x)\lambda(\mathbf{x}),无需额外构造。
  3. 拒绝域方向明确:拒绝域总是 {λc}{\lambda \le c} 的形式,我们只需要确定临界值 cc

似然比检验的实践:关键技巧与案例

在实际应用中,直接使用 λ(x)\lambda(\mathbf{x}) 进行检验可能会遇到一个困难:λ(X)\lambda(\mathbf{X}) 在原假设下的精确分布(零分布)通常难以求得,从而无法确定临界值 cc

解决这一问题的关键技巧是:寻找一个与 λ\lambda 单调相关的、其分布已知的统计量 TT

技巧:利用单调变换

假设存在一个统计量 T=T(X)T = T(\mathbf{X}),使得 λ(X)\lambda(\mathbf{X})TT 的单调函数。例如,若 λ\lambdaTT单调递减函数,那么事件 {λc}{\lambda \le c} 就等价于事件 {Td}{T \ge d}(其中 dd 是某个由 cc 决定的常数)。由于 TT 的零分布已知(或更易求得),我们就可以转而利用 TT 来构造拒绝域,并确定相应的临界值 dd

许多常见的检验统计量,如 UU 统计量、tt 统计量、FF 统计量、卡方统计量,正是通过这种方式从似然比中推导出来的。

下面通过三个典型案例来演示似然比检验的应用流程和上述技巧。

案例一:单正态总体均值的双边检验

问题:设 X1,,Xni.i.d.N(μ,σ2)X_1, \ldots, X_n \stackrel{\text{i.i.d.}}{\sim} N(\mu, \sigma^2),其中 μ,σ2\mu, \sigma^2 均未知。求检验问题 H0:μ=μ0H_0: \mu = \mu_0 vs H1:μμ0H_1: \mu \ne \mu_0 的水平为 α\alpha 的似然比检验。

求解步骤

  1. 写出似然函数L(μ,σ2;x)=(2πσ2)n/2exp{12σ2i=1n(xiμ)2}L(\mu, \sigma^2; \mathbf{x}) = (2\pi\sigma^2)^{-n/2} \exp\left{-\frac{1}{2\sigma^2}\sum_{i=1}^n (x_i - \mu)^2\right} 参数空间:Θ={(μ,σ2):μR,σ2>0}\Theta = {(\mu, \sigma^2): \mu \in \mathbb{R}, \sigma^2 > 0}。 原假设空间:Θ0={(μ0,σ2):σ2>0}\Theta_0 = {(\mu_0, \sigma^2): \sigma^2 > 0}

  2. 求分母的极大值(全空间MLE): 正态分布的极大似然估计为 μ^=xˉ\hat{\mu} = \bar{x}, σ^2=1ni=1n(xixˉ)2\hat{\sigma}^2 = \frac{1}{n}\sum_{i=1}^n (x_i - \bar{x})^2。代入得: supΘL=(2πσ^2)n/2en/2\sup_{\Theta} L = (2\pi \hat{\sigma}^2)^{-n/2} e^{-n/2}

  3. 求分子的极大值(H0H_0约束下的MLE): 在 H0H_0 下,μ\mu 固定为 μ0\mu_0,只需对 σ2\sigma^2 求极大。易得约束下的MLE为 σ2=1ni=1n(xiμ0)2\tilde{\sigma}^2 = \frac{1}{n}\sum_{i=1}^n (x_i - \mu_0)^2。代入得: supΘ0L=(2πσ2)n/2en/2\sup_{\Theta_0} L = (2\pi \tilde{\sigma}^2)^{-n/2} e^{-n/2}

  4. 构造似然比统计量λ(x)=supΘ0LsupΘL=(σ^2σ2)n/2=((xixˉ)2(xiμ0)2)n/2\lambda(\mathbf{x}) = \frac{\sup_{\Theta_0} L}{\sup_{\Theta} L} = \left( \frac{\hat{\sigma}^2}{\tilde{\sigma}^2} \right)^{n/2} = \left( \frac{\sum (x_i - \bar{x})^2}{\sum (x_i - \mu_0)^2} \right)^{n/2}

  5. 化简并寻找单调统计量: 经过代数变形(具体过程略),可以得到: λ(x)=(1+t2n1)n/2\lambda(\mathbf{x}) = \left( 1 + \frac{t^2}{n-1} \right)^{-n/2} 其中 t=xˉμ0s/nt = \frac{\bar{x} - \mu_0}{s / \sqrt{n}},而 s2=1n1(xixˉ)2s^2 = \frac{1}{n-1}\sum (x_i - \bar{x})^2 为样本方差。这正是我们熟悉的 tt 统计量。 观察函数 f(t)=(1+t2n1)n/2f(t) = (1 + \frac{t^2}{n-1})^{-n/2},它是 t|t|单调递减函数

  6. 确定拒绝域: 由于 λc\lambda \le c 等价于 td|t| \ge d(其中 ddcc 决定)。而我们知道,当 H0H_0 成立时,tt(n1)t \sim t(n-1)。因此,为了控制第一类错误为 α\alpha,我们取 d=tα/2(n1)d = t_{\alpha/2}(n-1),即 tt 分布的上 α/2\alpha/2 分位数。 最终拒绝域为W={x:ttα/2(n1)}W = {\mathbf{x}: |t| \ge t_{\alpha/2}(n-1)} 这正是我们熟知的双边 tt 检验。此例表明,对于正态均值双边检验,似然比检验与传统的 tt 检验完全等价。

import numpy as np
import scipy.stats as stats

# 案例一:单正态总体均值双边检验的模拟验证
np.random.seed(321)  # 固定随机种子
mu0 = 5.0            # 原假设均值
sigma = 2.0          # 总体标准差(未知)
n = 30               # 样本量
alpha = 0.05         # 显著性水平

# 生成一组样本(假设真实均值为5.5,即H0不成立)
true_mu = 5.5
sample = np.random.normal(loc=true_mu, scale=sigma, size=n)

# 计算样本统计量
x_bar = np.mean(sample)
s = np.std(sample, ddof=1)  # 样本标准差,无偏估计
t_stat = (x_bar - mu0) / (s / np.sqrt(n))

# 计算临界值
t_critical = stats.t.ppf(1 - alpha/2, df=n-1)

# 计算p值(双边)
p_value = 2 * (1 - stats.t.cdf(abs(t_stat), df=n-1))

print("案例一:单正态总体均值双边检验")
print(f"样本均值 x̄ = {x_bar:.4f}")
print(f"样本标准差 s = {s:.4f}")
print(f"t 统计量 = {t_stat:.4f}")
print(f"t 临界值 (α={alpha}) = ±{t_critical:.4f}")
print(f"p 值 = {p_value:.4f}")
if abs(t_stat) > t_critical:
    print("结论:拒绝原假设 H0 (μ = μ0)")
else:
    print("结论:不拒绝原假设 H0")
print("-" * 50)

案例二:指数分布尺度参数的检验

问题:设 X1,,Xni.i.d.f(x;θ)=θeθx,x>0X_1, \ldots, X_n \stackrel{\text{i.i.d.}}{\sim} f(x;\theta) = \theta e^{-\theta x}, x>0,其中 θ>0\theta > 0 未知。求检验问题 H0:θ=θ0H_0: \theta = \theta_0 vs H1:θθ0H_1: \theta \ne \theta_0 的水平为 α\alpha 的似然比检验。

求解步骤

  1. 写出似然函数L(θ;x)=θnexp(θi=1nxi),xi>0L(\theta; \mathbf{x}) = \theta^n \exp\left(-\theta \sum_{i=1}^n x_i\right), \quad x_i > 0 参数空间:Θ={θ:θ>0}\Theta = {\theta: \theta > 0}。 原假设空间:Θ0={θ0}\Theta_0 = {\theta_0}

  2. 求分母的极大值(全空间MLE): 指数分布的MLE为 θ^=1xˉ\hat{\theta} = \frac{1}{\bar{x}}。代入得: supΘL=(1xˉ)nexp(n)\sup_{\Theta} L = \left(\frac{1}{\bar{x}}\right)^n \exp(-n)

  3. 求分子的极大值(H0H_0约束下的MLE)Θ0\Theta_0 只有一个点 θ0\theta_0,直接代入: supΘ0L=θ0nexp(θ0nxˉ)\sup_{\Theta_0} L = \theta_0^n \exp\left(-\theta_0 n\bar{x}\right)

  4. 构造似然比统计量λ(x)=θ0neθ0nxˉ(1/xˉ)nen=(θ0xˉ)nen(1θ0xˉ)\lambda(\mathbf{x}) = \frac{\theta_0^n e^{-\theta_0 n\bar{x}}}{(1/\bar{x})^n e^{-n}} = (\theta_0 \bar{x})^n e^{n(1 - \theta_0 \bar{x})}

  5. 化简并寻找单调统计量: 观察 λ(x)\lambda(\mathbf{x}) 的结构:令 u=θ0xˉu = \theta_0 \bar{x},则 λ=unen(1u)\lambda = u^n e^{n(1-u)}。对它求导可知,λ\lambdau=1u = 1(即 xˉ=1/θ0\bar{x} = 1/\theta_0,恰为 MLE 处)取得最大值 1;当 u<1u < 1 时单调递增,当 u>1u > 1 时单调递减。也就是说,λ\lambdaXˉ\bar{X}单峰函数,而非单调函数。 因此,拒绝域 {λc}{\lambda \le c} 具有双侧形式 {Xˉd1}{Xˉd2}{\bar{X} \le d_1} \cup {\bar{X} \ge d_2}d1<d2d_1 < d_2cc 决定)。一个更常用的变换是考虑 2nθ0Xˉ2n\theta_0 \bar{X}。可以证明,在原假设 H0:θ=θ0H_0: \theta = \theta_0 下,统计量 2nθ0Xˉχ2(2n)2n\theta_0 \bar{X} \sim \chi^2(2n)(由 Xˉ\bar{X} 服从 Gamma 分布易得)。

  6. 确定拒绝域: 由于 λ\lambda2nθ0Xˉ2n\theta_0 \bar{X} 的单峰函数,拒绝域 {λc}{\lambda \le c} 等价于 {2nθ0Xˉc1}{2nθ0Xˉc2}{2n\theta_0 \bar{X} \le c_1} \cup {2n\theta_0 \bar{X} \ge c_2}。实践中按等尾原则取 c1=χ1α/22(2n)c_1 = \chi^2_{1-\alpha/2}(2n)c2=χα/22(2n)c_2 = \chi^2_{\alpha/2}(2n),其中 χα2(2n)\chi^2_{\alpha}(2n) 是自由度为 2n2n 的卡方分布的上 α\alpha 分位数。 最终拒绝域为W={x:2nθ0xˉχ1α/22(2n) 或 2nθ0xˉχα/22(2n)}W = {\mathbf{x}: 2n\theta_0 \bar{x} \le \chi^2_{1-\alpha/2}(2n) \ \text{或} \ 2n\theta_0 \bar{x} \ge \chi^2_{\alpha/2}(2n)} 此例展示了如何将非正态总体(指数分布)的检验问题,通过似然比方法转化为一个卡方检验。

案例三:多项分布概率的检验(通向拟合优度检验)

问题:设 (X1,,Xn)(X_1, \ldots, X_n) 为来自多项分布 M(n;p1,,pr)M(n; p_1, \ldots, p_r) 的样本,其中 i=1rpi=1\sum_{i=1}^r p_i = 1pi>0p_i > 0。令 nin_i 表示 nn 次试验中结果 ii 出现的次数。考虑检验 H0:pi=pi0,i=1,,rH_0: p_i = p_{i0}, i=1,\ldots,r vs H1:至少有一个 pipi0H_1: \text{至少有一个 } p_i \ne p_{i0},其中 pi0p_{i0} 是已知的一组概率值。

求解步骤

  1. 写出似然函数L(p1,,pr;n)=n!n1!nr!p1n1prnrL(p_1, \ldots, p_r; \mathbf{n}) = \frac{n!}{n_1! \cdots n_r!} p_1^{n_1} \cdots p_r^{n_r} 参数空间:Θ={(p1,,pr):pi>0,pi=1}\Theta = {(p_1, \ldots, p_r): p_i > 0, \sum p_i = 1}。 原假设空间:Θ0={(p10,,pr0)}\Theta_0 = {(p_{10}, \ldots, p_{r0})}

  2. 求分母的极大值(全空间MLE): 多项分布的MLE为 p^i=ni/n\hat{p}i = n_i / n。代入得: supΘL=n!n1!nr!(n1n)n1(nrn)nr\sup{\Theta} L = \frac{n!}{n_1! \cdots n_r!} \left(\frac{n_1}{n}\right)^{n_1} \cdots \left(\frac{n_r}{n}\right)^{n_r}

  3. 求分子的极大值(H0H_0约束下的MLE): 直接代入 pi=pi0p_i = p_{i0}supΘ0L=n!n1!nr!p10n1pr0nr\sup_{\Theta_0} L = \frac{n!}{n_1! \cdots n_r!} p_{10}^{n_1} \cdots p_{r0}^{n_r}

  4. 构造似然比统计量λ=p10n1pr0nr(n1/n)n1(nr/n)nr\lambda = \frac{p_{10}^{n_1} \cdots p_{r0}^{n_r}}{(n_1/n)^{n_1} \cdots (n_r/n)^{n_r}}

  5. 取对数并寻找渐近分布: 考虑 2lnλ-2\ln \lambda2lnλ=2i=1rniln(ninpi0)-2\ln \lambda = 2 \sum_{i=1}^r n_i \ln\left(\frac{n_i}{n p_{i0}}\right) 这是一个非常重要的统计量。Wilks定理指出,在大样本下(nn \to \infty),当 H0H_0 成立时,2lnλ-2\ln \lambda 近似服从自由度为 r1r-1 的卡方分布,即 2lnλχ2(r1)-2\ln \lambda \stackrel{\cdot}{\sim} \chi^2(r-1)

  6. 确定拒绝域(大样本近似): 由于 2lnλ-2\ln \lambdaλ\lambda 的严格单调递减函数,拒绝域 {λc}{\lambda \le c} 等价于 {2lnλd}{-2\ln \lambda \ge d}。 利用渐近分布,取 d=χα2(r1)d = \chi^2_{\alpha}(r-1)最终拒绝域为W={n:2i=1rniln(ninpi0)χα2(r1)}W = {\mathbf{n}: -2 \sum_{i=1}^r n_i \ln\left(\frac{n_i}{n p_{i0}}\right) \ge \chi^2_{\alpha}(r-1)} 这正是似然比卡方检验。与之紧密相关的另一个著名统计量是 Pearson卡方统计量χ2=i=1r(ninpi0)2npi0\chi^2 = \sum_{i=1}^r \frac{(n_i - n p_{i0})^2}{n p_{i0}} 在大样本下,它与 2lnλ-2\ln \lambda 有相同的渐近分布 χ2(r1)\chi^2(r-1)。Pearson卡方统计量就是第五章将要详细讨论的拟合优度检验的核心。本例揭示了似然比检验与拟合优度检验之间的深刻联系。

# 案例三:多项分布概率检验的模拟验证 (Wilks定理)
np.random.seed(321)
# 原假设:三种产品的市场占有率分别为 1/3, 1/3, 1/3
p0 = np.array([1/3, 1/3, 1/3])
# 模拟抽样:实际调查了200名消费者,真实偏好可能略有不同
true_p = np.array([0.40, 0.35, 0.25])  # 真实概率
n = 200
# 生成多项分布样本(观测频数)
observed_counts = np.random.multinomial(n, true_p)

# 计算期望频数
expected_counts = n * p0

# 计算似然比统计量 -2lnλ
lr_stat = 2 * np.sum(observed_counts * np.log(observed_counts / expected_counts))
# 计算Pearson卡方统计量
pearson_stat = np.sum((observed_counts - expected_counts)**2 / expected_counts)

# 临界值 (α=0.05, df=3-1=2)
chi2_critical = stats.chi2.ppf(0.95, df=2)
# p值
lr_pvalue = 1 - stats.chi2.cdf(lr_stat, df=2)
pearson_pvalue = 1 - stats.chi2.cdf(pearson_stat, df=2)

print("案例三:多项分布概率检验(拟合优度)")
print(f"观测频数: {observed_counts}")
print(f"期望频数: {expected_counts}")
print(f"似然比统计量 -2lnλ = {lr_stat:.4f}")
print(f"Pearson卡方统计量 χ² = {pearson_stat:.4f}")
print(f"卡方临界值 (α=0.05, df=2) = {chi2_critical:.4f}")
print(f"-2lnλ 的 p 值 = {lr_pvalue:.4f}")
print(f"Pearson χ² 的 p 值 = {pearson_pvalue:.4f}")
if lr_stat > chi2_critical:
    print("结论(基于-2lnλ):拒绝原假设,认为市场占有率不是均等的。")
else:
    print("结论(基于-2lnλ):不拒绝原假设。")
print("-" * 50)

📝 动手练一练

  1. 单正态总体方差检验:设 X1,,Xni.i.d.N(μ,σ2)X_1, \ldots, X_n \stackrel{\text{i.i.d.}}{\sim} N(\mu, \sigma^2),其中 μ\mu 已知。考虑检验 H0:σ2=σ02H_0: \sigma^2 = \sigma_0^2 vs H1:σ2σ02H_1: \sigma^2 \ne \sigma_0^2。 a) 请写出该问题的似然比统计量 λ(x)\lambda(\mathbf{x})。 b) 证明 λ(x)\lambda(\mathbf{x}) 是统计量 T=i=1n(Xiμ)2σ02T = \frac{\sum_{i=1}^n (X_i - \mu)^2}{\sigma_0^2} 的单调函数,并指出其单调性。 c) 利用 TT 的分布(在原假设下),写出水平为 α\alpha 的似然比检验的拒绝域。

  2. 大样本似然比检验应用:一项关于消费者对三种新包装偏好的调查中,随机抽取了200人,选择包装A、B、C的人数分别为85、70、45。商家想检验消费者对三种包装的偏好是否均等(即 H0:pA=pB=pC=1/3H_0: p_A = p_B = p_C = 1/3)。 a) 计算该检验问题的似然比统计量 2lnλ-2\ln\lambda。 b) 计算对应的Pearson卡方统计量。 c) 在 α=0.05\alpha=0.05 水平下,根据卡方分布做出检验决策。

参考答案

  1. a) λ(x)=((xiμ)2nσ02)n/2exp{n2(xiμ)22σ02}\lambda(\mathbf{x}) = \left( \frac{\sum (x_i - \mu)^2}{n\sigma_0^2} \right)^{n/2} \exp\left{ \frac{n}{2} - \frac{\sum (x_i - \mu)^2}{2\sigma_0^2} \right}。 b) 令 t=(xiμ)2/σ02t = \sum (x_i - \mu)^2 / \sigma_0^2,则 λ=(t/n)n/2en/2t/2\lambda = (t/n)^{n/2} e^{n/2 - t/2}。可以证明 λ\lambdatt 的单峰函数,当 t<nt < n 时单调增,当 t>nt > n 时单调减。拒绝域 {λc}{\lambda \le c} 等价于 {tc1}{tc2}{t \le c_1} \cup {t \ge c_2}。 c) 由于 Tχ2(n)T \sim \chi^2(n),拒绝域为:{Tχ1α/22(n)}{Tχα/22(n)}{T \le \chi^2_{1-\alpha/2}(n)} \cup {T \ge \chi^2_{\alpha/2}(n)}

  2. a) 2lnλ=2[85ln(85/(200/3))+70ln(70/(200/3))+45ln(45/(200/3))]12.76-2\ln\lambda = 2[85\ln(85/(200/3)) + 70\ln(70/(200/3)) + 45\ln(45/(200/3))] \approx 12.76。 b) Pearson卡方统计量:χ2=(85200/3)2200/3+(70200/3)2200/3+(45200/3)2200/312.25\chi^2 = \frac{(85-200/3)^2}{200/3} + \frac{(70-200/3)^2}{200/3} + \frac{(45-200/3)^2}{200/3} \approx 12.25。 c) 自由度 df=31=2df = 3-1 = 2χ0.052(2)=5.99\chi^2_{0.05}(2) = 5.99。由于 12.76>5.9912.76 > 5.9912.25>5.9912.25 > 5.99,两个统计量均拒绝原假设,认为消费者对三种包装的偏好不是均等的。

本章小结

本节系统介绍了假设检验中一个极其重要且实用的方法——似然比检验

要点回顾

  • 动机:为解决一般性假设检验问题(H0:θΘ0H_0: \theta \in \Theta_0)提供统一的检验统计量构造方法。
  • 核心:似然比统计量 λ=supΘ0L(θ)supΘL(θ)\lambda = \frac{\sup_{\Theta_0} L(\theta)}{\sup_{\Theta} L(\theta)},其值越小,数据越不支持原假设。
  • 检验定义:拒绝域为 {λc}{\lambda \le c}cc 由控制第一类错误概率 α\le \alpha 确定。
  • 实践技巧:当 λ\lambda 的精确分布未知时,寻找一个与之单调相关、分布已知的统计量(如 tt, FF, χ2\chi^2)来等价构造检验;当 λ\lambda 是某统计量的单峰函数时(如案例二与练习题1),拒绝域为双侧形式。
  • 大样本理论:Wilks定理保证了在正则条件下,2lnλχ2(df)-2\ln\lambda \stackrel{\cdot}{\sim} \chi^2(\text{df}),其中自由度 df=dim(Θ)dim(Θ0)\text{df} = \dim(\Theta) - \dim(\Theta_0)。这是许多拟合优度检验的理论基石。
  • 广泛应用:从正态总体到非正态总体(如指数分布、多项分布),从连续数据到离散数据,似然比检验都提供了可行的检验路径。

行动清单

  1. 掌握标准流程:面对一个参数检验问题,尝试按照“写似然函数 → 求约束/无约束MLE → 构造 λ\lambda → 化简找单调统计量 → 利用已知分布定拒绝域”的步骤进行推导。
  2. 代码验证:使用Python的scipy.stats模块,对你推导出的检验统计量进行模拟抽样,验证其分布(尤其是零分布)是否与理论一致,并计算实际的检验功效。
  3. 联系前后知识:理解似然比检验与极大似然估计的思想关联,并预习第五章,了解基于似然比渐近分布的卡方检验如何用于分布的拟合优度检验。

— 小象教研组

配套学习资源与课件
  • 第4章课件:假设检验(PDF · 7.6MB)
    下载
🎁 免费学习资源

领取《小象 11GB VIP 课件资料包与大厂真题手册》

包含全套实战 Jupyter 源码、清洗后数据集、大厂高频面试真题与专属学员答疑交流群。

  • 完整 Python / 数据分析 Jupyter 实战源码
  • 大厂真实业务数据集与练习题
  • 微信扫码添加课程顾问,免费获取网盘下载链接
微信二维码:扫码添加课程顾问微信扫码添加顾问