知经百科 / S

似然比检验 (Likelihood-Ratio Test, LRT)

似然比检验 (Likelihood-Ratio Test, LRT)

似然比检验(Likelihood-Ratio Test, 简称 LRT)是统计学中三大经典假设检验方法之一(另两种为沃尔德检验拉格朗日乘数检验),广泛应用于参数假设检验模型选择假设检验的框架中。其核心思想是:比较在约束条件(原假设 H0H_0)下和无约束条件(备择假设 H1H_1)下,模型似然函数的最大值之比。若该比值显著偏离 1,说明约束条件对拟合优度造成了显著损害,从而有证据拒绝原假设。

定义与统计量

记样本数据为 X=(X1,X2,,Xn)\mathbf{X} = (X_1, X_2, \dots, X_n),其联合概率密度函数(或概率质量函数)为 f(Xθ)f(\mathbf{X} \mid \theta),其中 θΘRk\theta \in \Theta \subseteq \mathbb{R}^k 为参数向量。考虑如下检验问题:

H0:θΘ0vs.H1:θΘ1H_0: \theta \in \Theta_0 \quad \text{vs.} \quad H_1: \theta \in \Theta_1

其中 Θ0Θ\Theta_0 \subset \ThetaΘ1=ΘΘ0\Theta_1 = \Theta \setminus \Theta_0。定义似然比统计量为:

λ(X)=supθΘ0L(θX)supθΘL(θX)\lambda(\mathbf{X}) = \frac{\sup_{\theta \in \Theta_0} L(\theta \mid \mathbf{X})}{\sup_{\theta \in \Theta} L(\theta \mid \mathbf{X})}

其中 L(θX)=f(Xθ)L(\theta \mid \mathbf{X}) = f(\mathbf{X} \mid \theta)似然函数。分子是原假设约束下的最大似然值,分母是无约束下的最大似然值。由定义可知 0λ(X)10 \le \lambda(\mathbf{X}) \le 1λ\lambda 越接近于 0,表明原假设下的拟合效果远差于无约束模型,越倾向于拒绝 H0H_0

在实际应用中,通常使用对数似然比 LR=2lnλ(X)LR = -2 \ln \lambda(\mathbf{X}),在原假设成立且满足正则条件下,该统计量渐近服从卡方分布

LR=2lnλ(X)dχν2LR = -2 \ln \lambda(\mathbf{X}) \xrightarrow{d} \chi^2_{\nu}

其中自由度 ν=dim(Θ)dim(Θ0)\nu = \dim(\Theta) - \dim(\Theta_0),即全模型参数个数减去约束模型参数个数。

理论性质

Neyman-Pearson 引理

在简单原假设对简单备择假设(即 H0:θ=θ0H_0: \theta = \theta_0H1:θ=θ1H_1: \theta = \theta_1)的情形下,Neyman-Pearson 引理证明了似然比检验是最优的:在所有给定显著性水平的检验中,似然比检验具有最大的检验功效(即最小化第二类错误概率)。这是 LRT 在理论上被广泛认可的核心优势。

渐近最优性

对于复合假设检验(参数空间含多余参数),在正则条件下,似然比检验具有渐近最优性——它是一致最大功效检验(Uniformly Most Powerful, UMP)的渐近版本。Wald 检验、LM 检验和 LRT 三者在大样本下是渐近等价的,但在有限样本中行为有所差异。

与 Wald 检验和 LM 检验的关系

三者均基于最大似然估计框架:

  • Wald 检验:仅需估计无约束模型,检验约束条件是否显著偏离估计值。
  • LM 检验(拉格朗日乘数检验):仅需估计约束模型,检验约束条件的拉格朗日乘子是否显著异于零。
  • LRT:需同时估计约束与无约束模型,比较两者似然值的差异。

一般而言,三者在有限样本中满足不等式 WLRLMW \ge LR \ge LM(在对应检验水平下),这一关系与信息矩阵的估计方式有关。

应用场景

嵌套模型选择

LRT 最常用于比较嵌套模型:即一个模型是另一个模型的特殊情况(通过施加参数约束得到)。例如,在线性回归中检验若干个回归系数是否同时为零:

H0:βq+1=βq+2==βk=0H_0: \beta_{q+1} = \beta_{q+2} = \dots = \beta_k = 0

此时 LRT 统计量渐近服从 χkq2\chi^2_{k-q} 分布。该检验在广义线性模型(GLM)、逻辑回归泊松回归等非正态模型中尤为常用。

方差分析中的似然比检验

方差分析(ANOVA)框架中,LRT 等价于传统的 F 检验。对于正态线性模型,似然比统计量与 F 统计量存在一一对应关系:

LR=nln(1+qnkF)LR = n \ln\left(1 + \frac{q}{n-k} F\right)

其中 qq 为约束个数,kk 为全模型参数个数。

结构方程模型与因子分析

结构方程模型(SEM)和因子分析中,LRT 被用于检验模型拟合优度:比较理论模型(约束模型)与饱和模型(无约束模型)之间的拟合差异。显著的 LRT 统计量意味着理论模型与数据之间存在显著差异,即模型拟合不佳。

局限性

  1. 有限样本偏差:LRT 的渐近卡方分布在大样本下成立,在有限样本中可能产生显著性水平扭曲 Bartlett 校正(Bartlett correction)可用于改善有限样本表现。
  2. 边界参数问题:当原假设下的参数位于参数空间的边界时(如检验方差为零),标准渐近理论失效,LRT 统计量的渐近分布成为混合卡方分布。
  3. 非嵌套模型比较:LRT 不适用于非嵌套模型比较,此时需改用AICBIC等信息准则或Vuong 检验
  4. 计算负担:相比 Wald 和 LM 检验,LRT 要求同时估计两个模型,在计算上更为昂贵。

数值示例

假设某线性回归模型包含 5 个自变量,欲检验其中 2 个变量的系数是否同时为零。估计无约束模型得到对数似然值 full=120.3\ell_{\text{full}} = -120.3,估计约束模型(去掉这 2 个变量)得到 restricted=124.7\ell_{\text{restricted}} = -124.7。则:

LR=2(restrictedfull)=2(124.7+120.3)=8.8LR = -2(\ell_{\text{restricted}} - \ell_{\text{full}}) = -2(-124.7 + 120.3) = 8.8

自由度 ν=53=2\nu = 5 - 3 = 2。查 χ22\chi^2_2 分布临界值:在 5\% 显著性水平下,临界值为 5.99。因 8.8>5.998.8 > 5.99,拒绝原假设,说明这 2 个变量至少有一个显著不为零。

推广形式

  • 广义似然比检验(Generalized Likelihood Ratio Test, GLRT):当备择假设涉及非参数或半参数设定时,LRT 的推广形式。
  • 序贯似然比检验(Sequential Probability Ratio Test, SPRT):由Abraham Wald提出,用于序贯抽样场景,样本量不事先固定,而是根据数据实时决定是否停止抽样并做出判断。
  • 带惩罚的似然比检验:在高维统计Lasso框架下,传统的 LRT 因正则化偏误而失效,需要引入调整后的似然比检验(如 post-selection inference 中的检验方法)。

历史注记

LRT 在时间序列分析中也有广泛应用。例如,在ARMA 模型的定阶问题中,可通过 LRT 比较不同滞后阶数的模型拟合优劣;在单位根检验中,Dickey-Fuller 检验在特定设定下可视为 LRT 的特殊形式。此外,在GARCH 模型的波动率建模中,LRT 常用于检验 ARCH 效应是否存在,即检验条件方差方程中各滞后项系数是否同时为零。

生物统计学流行病学中,LRT 广泛应用于逻辑回归模型的变量筛选和交互效应检验。在生存分析中,Cox 比例风险模型的偏似然比检验是评估协变量显著性的标准方法。在基因关联研究(GWAS)中,LRT 被用于检验单个核苷酸多态性(SNP)与性状之间的关联显著性。

机器学习领域,LRT 可辅助特征选择和模型比较。在混合模型潜变量模型中,LRT 可用于检验成分数目是否存在冗余。然而,由于边界参数问题的普遍存在,这些场景通常需要借助Bootstrap方法或调整后的检验统计量来确定 p 值。

与贝叶斯方法的关系

贝叶斯统计的视角看,LRT 与贝叶斯因子(Bayes factor)在概念上有相通之处:两者均通过比较两个模型的相对拟合程度做出判断。区别在于,LRT 仅关注最大似然点的比值(点估计),而贝叶斯因子需要对整个参数空间进行积分(边际似然比),天然地包含了模型复杂性惩罚。在模型不确定性较高或样本量较小的场景下,贝叶斯因子通常比 LRT 更稳健。

软件实现

主流统计软件均提供了 LRT 的计算功能。在 R 语言中,\texttt{lmtest} 包的 \texttt{lrtest()} 函数可直接比较嵌套模型;\texttt{anova()} 函数在指定 \texttt{test = "LRT"} 时输出似然比检验结果。在 Python 的 \texttt{statsmodels} 库中,\texttt{compare\_lr\_test()} 函数可实现类似功能。在 Stata 中,\texttt{lrtest} 命令用于在估计后比较两个嵌套模型。这些工具通常自动报告 LR 统计量、自由度和 p 值。

总结

似然比检验凭借其 Neyman-Pearson 意义下的最优性、与信息准则的内在联系,以及渐近卡方分布带来的便利性,已成为统计学中最核心的假设检验工具之一。其应用范围横跨计量经济学生物统计心理测量学自然语言处理等多个学科领域。理解 LRT 的原理及其与 Wald 检验、LM 检验的关系,是掌握现代统计推断方法的基石。

似然比检验的思想最早可追溯至Ronald Fisher在 1920 年代的工作。现代形式的 LRT 由Jerzy NeymanEgon Pearson在 1928-1933 年间严格形式化,其中 Neyman-Pearson 引理(1933)奠定了 LRT 在假设检验理论中的核心地位。Samuel Wilks 在 1938 年证明了 LRT 统计量的渐近卡方分布(即 Wilks 定理),为 LRT 的大样本应用提供了理论基础。

返回百科索引