似然比检验 (Likelihood-Ratio Test, LRT)
似然比检验 (Likelihood-Ratio Test, LRT)
似然比检验(Likelihood-Ratio Test, 简称 LRT)是统计学中三大经典假设检验方法之一(另两种为沃尔德检验和拉格朗日乘数检验),广泛应用于参数假设检验、模型选择和假设检验的框架中。其核心思想是:比较在约束条件(原假设 )下和无约束条件(备择假设 )下,模型似然函数的最大值之比。若该比值显著偏离 1,说明约束条件对拟合优度造成了显著损害,从而有证据拒绝原假设。
定义与统计量
记样本数据为 ,其联合概率密度函数(或概率质量函数)为 ,其中 为参数向量。考虑如下检验问题:
其中 ,。定义似然比统计量为:
其中 为似然函数。分子是原假设约束下的最大似然值,分母是无约束下的最大似然值。由定义可知 。 越接近于 0,表明原假设下的拟合效果远差于无约束模型,越倾向于拒绝 。
在实际应用中,通常使用对数似然比 ,在原假设成立且满足正则条件下,该统计量渐近服从卡方分布:
其中自由度 ,即全模型参数个数减去约束模型参数个数。
理论性质
Neyman-Pearson 引理
在简单原假设对简单备择假设(即 对 )的情形下,Neyman-Pearson 引理证明了似然比检验是最优的:在所有给定显著性水平的检验中,似然比检验具有最大的检验功效(即最小化第二类错误概率)。这是 LRT 在理论上被广泛认可的核心优势。
渐近最优性
对于复合假设检验(参数空间含多余参数),在正则条件下,似然比检验具有渐近最优性——它是一致最大功效检验(Uniformly Most Powerful, UMP)的渐近版本。Wald 检验、LM 检验和 LRT 三者在大样本下是渐近等价的,但在有限样本中行为有所差异。
与 Wald 检验和 LM 检验的关系
三者均基于最大似然估计框架:
- Wald 检验:仅需估计无约束模型,检验约束条件是否显著偏离估计值。
- LM 检验(拉格朗日乘数检验):仅需估计约束模型,检验约束条件的拉格朗日乘子是否显著异于零。
- LRT:需同时估计约束与无约束模型,比较两者似然值的差异。
一般而言,三者在有限样本中满足不等式 (在对应检验水平下),这一关系与信息矩阵的估计方式有关。
应用场景
嵌套模型选择
LRT 最常用于比较嵌套模型:即一个模型是另一个模型的特殊情况(通过施加参数约束得到)。例如,在线性回归中检验若干个回归系数是否同时为零:
此时 LRT 统计量渐近服从 分布。该检验在广义线性模型(GLM)、逻辑回归、泊松回归等非正态模型中尤为常用。
方差分析中的似然比检验
在方差分析(ANOVA)框架中,LRT 等价于传统的 F 检验。对于正态线性模型,似然比统计量与 F 统计量存在一一对应关系:
其中 为约束个数, 为全模型参数个数。
结构方程模型与因子分析
在结构方程模型(SEM)和因子分析中,LRT 被用于检验模型拟合优度:比较理论模型(约束模型)与饱和模型(无约束模型)之间的拟合差异。显著的 LRT 统计量意味着理论模型与数据之间存在显著差异,即模型拟合不佳。
局限性
- 有限样本偏差:LRT 的渐近卡方分布在大样本下成立,在有限样本中可能产生显著性水平扭曲。 Bartlett 校正(Bartlett correction)可用于改善有限样本表现。
- 边界参数问题:当原假设下的参数位于参数空间的边界时(如检验方差为零),标准渐近理论失效,LRT 统计量的渐近分布成为混合卡方分布。
- 非嵌套模型比较:LRT 不适用于非嵌套模型比较,此时需改用AIC、BIC等信息准则或Vuong 检验。
- 计算负担:相比 Wald 和 LM 检验,LRT 要求同时估计两个模型,在计算上更为昂贵。
数值示例
假设某线性回归模型包含 5 个自变量,欲检验其中 2 个变量的系数是否同时为零。估计无约束模型得到对数似然值 ,估计约束模型(去掉这 2 个变量)得到 。则:
自由度 。查 分布临界值:在 5\% 显著性水平下,临界值为 5.99。因 ,拒绝原假设,说明这 2 个变量至少有一个显著不为零。
推广形式
- 广义似然比检验(Generalized Likelihood Ratio Test, GLRT):当备择假设涉及非参数或半参数设定时,LRT 的推广形式。
- 序贯似然比检验(Sequential Probability Ratio Test, SPRT):由Abraham Wald提出,用于序贯抽样场景,样本量不事先固定,而是根据数据实时决定是否停止抽样并做出判断。
- 带惩罚的似然比检验:在高维统计和Lasso框架下,传统的 LRT 因正则化偏误而失效,需要引入调整后的似然比检验(如 post-selection inference 中的检验方法)。
历史注记
LRT 在时间序列分析中也有广泛应用。例如,在ARMA 模型的定阶问题中,可通过 LRT 比较不同滞后阶数的模型拟合优劣;在单位根检验中,Dickey-Fuller 检验在特定设定下可视为 LRT 的特殊形式。此外,在GARCH 模型的波动率建模中,LRT 常用于检验 ARCH 效应是否存在,即检验条件方差方程中各滞后项系数是否同时为零。
在生物统计学和流行病学中,LRT 广泛应用于逻辑回归模型的变量筛选和交互效应检验。在生存分析中,Cox 比例风险模型的偏似然比检验是评估协变量显著性的标准方法。在基因关联研究(GWAS)中,LRT 被用于检验单个核苷酸多态性(SNP)与性状之间的关联显著性。
在机器学习领域,LRT 可辅助特征选择和模型比较。在混合模型和潜变量模型中,LRT 可用于检验成分数目是否存在冗余。然而,由于边界参数问题的普遍存在,这些场景通常需要借助Bootstrap方法或调整后的检验统计量来确定 p 值。
与贝叶斯方法的关系
从贝叶斯统计的视角看,LRT 与贝叶斯因子(Bayes factor)在概念上有相通之处:两者均通过比较两个模型的相对拟合程度做出判断。区别在于,LRT 仅关注最大似然点的比值(点估计),而贝叶斯因子需要对整个参数空间进行积分(边际似然比),天然地包含了模型复杂性惩罚。在模型不确定性较高或样本量较小的场景下,贝叶斯因子通常比 LRT 更稳健。
软件实现
主流统计软件均提供了 LRT 的计算功能。在 R 语言中,\texttt{lmtest} 包的 \texttt{lrtest()} 函数可直接比较嵌套模型;\texttt{anova()} 函数在指定 \texttt{test = "LRT"} 时输出似然比检验结果。在 Python 的 \texttt{statsmodels} 库中,\texttt{compare\_lr\_test()} 函数可实现类似功能。在 Stata 中,\texttt{lrtest} 命令用于在估计后比较两个嵌套模型。这些工具通常自动报告 LR 统计量、自由度和 p 值。
总结
似然比检验凭借其 Neyman-Pearson 意义下的最优性、与信息准则的内在联系,以及渐近卡方分布带来的便利性,已成为统计学中最核心的假设检验工具之一。其应用范围横跨计量经济学、生物统计、心理测量学、自然语言处理等多个学科领域。理解 LRT 的原理及其与 Wald 检验、LM 检验的关系,是掌握现代统计推断方法的基石。
似然比检验的思想最早可追溯至Ronald Fisher在 1920 年代的工作。现代形式的 LRT 由Jerzy Neyman和Egon Pearson在 1928-1933 年间严格形式化,其中 Neyman-Pearson 引理(1933)奠定了 LRT 在假设检验理论中的核心地位。Samuel Wilks 在 1938 年证明了 LRT 统计量的渐近卡方分布(即 Wilks 定理),为 LRT 的大样本应用提供了理论基础。