White Test
怀特检验 (White Test)
怀特检验 (White Test),全称为 White's General Heteroscedasticity Test,是由 计量经济学 家 哈尔伯特·怀特 (Halbert White) 于1980年在其经典论文 A Heteroskedasticity-Consistent Covariance Matrix Estimator and a Direct Test for Heteroskedasticity 中提出的一种 统计检验 方法。该检验专门用于检测 线性回归模型 中 误差项 是否存在 异方差性 (Heteroscedasticity),即误差项的 方差 随 解释变量 的变化而变化的情形。与 Breusch-Pagan 检验 等同类方法相比,怀特检验的最大优势在于不需要事先假定异方差的具体函数形式,是一种 纯粹的非参数化检验 (Pure Non-parametric Test),因而在实际应用中具有广泛的适用性。
背景与动机
在线性回归模型 中,经典线性回归模型 的 高斯-马尔可夫定理 (Gauss-Markov Theorem) 要求误差项满足 同方差性 (Homoscedasticity) 假定,即 为常数。然而,在 横截面数据 (Cross-sectional Data) 分析中,异方差性是极为常见的问题。例如,在分析 家庭消费 数据时,高收入家庭的消费波动幅度通常显著大于低收入家庭;在研究 企业研发支出 时,大型企业的支出变异程度也远高于小型企业。若忽视异方差性,普通最小二乘法 (OLS) 的 参数估计 虽仍保持 无偏性 (Unbiasedness) 和 一致性 (Consistency),但其 标准误 估计将出现偏差,导致 t检验 和 F检验 的统计推断结论失效。怀特检验正是在这一背景下应运而生,为研究者提供了一种便捷可靠的异方差诊断工具。
检验原理与步骤
怀特检验的核心思想是利用 OLS 残差 的平方作为异方差性的代理变量,通过检验残差平方与解释变量及其交叉项和平方项之间的 回归 关系的整体显著性,来判断是否存在异方差性。具体步骤如下:
- 估计原模型:首先对线性回归模型进行 OLS 估计,得到参数估计值 和残差序列 : \[ y_i = \mathbf{x}_i^{\top} \hat{\boldsymbol{\beta}} + \hat{\varepsilon}_i \] 其中 为 解释变量向量。
- 构造辅助回归:以残差平方 为 被解释变量,以原始解释变量、所有解释变量的平方项及两两交叉项作为解释变量,建立辅助回归模型: \[ \hat{\varepsilon}_i^2 = \alpha_0 + \sum_{j=1}^{k} \alpha_j x_{ij} + \sum_{j=1}^{k} \gamma_j x_{ij}^2 + \sum_{j < l} \delta_{jl} x_{ij} x_{il} + v_i \] 其中 为辅助回归的误差项。记辅助回归中的解释变量总数为 ,注意 会随着 的增大而迅速增加。
- 计算检验统计量:怀特检验采用 LM 检验 (Lagrange Multiplier Test) 框架,检验统计量为: \[ \text{LM} = n \cdot R^2_{\text{aux}} \sim \chi^2(p) \] 其中 为 样本量, 为辅助回归方程的 判定系数 (Coefficient of Determination)。在原假设 同方差性成立的条件下,该统计量 渐近 服从 自由度 为 的 卡方分布 (Chi-squared Distribution)。
- 判断结论:给定显著性水平 ,若 或对应的 p值 小于 ,则拒绝同方差的原假设,判定模型存在异方差性。
怀特检验与 Breusch-Pagan 检验的对比
怀特检验与 Breusch-Pagan 检验 (Breusch-Pagan Test, 1979) 是异方差检验中最为常用的两种方法,两者既有联系又有重要区别。
- 函数形式假定:Breusch-Pagan 检验假定异方差是解释变量的某个已知线性函数,即 ,其中 是 的某个已知子集。而怀特检验不要求任何函数形式预设,将检验范围扩展到所有平方项和交叉项,是一种更通用的检验方法。
- 检验效力:当异方差的形式确实为线性时,Breusch-Pagan 检验具有更高的 统计功效 (Statistical Power)。但当异方差的形式较为复杂(如包含非线性关系时),怀特检验的优势更为明显。
- 自由度消耗:怀特检验的辅助回归中包含大量平方项和交叉项,自由度消耗较大。当解释变量个数 较大时,辅助回归的解释变量总数 会迅速膨胀,在中等样本下可能导致检验效能下降。
- 嵌套关系:从本质上讲,Breusch-Pagan 检验可以视为怀特检验的一个特例——当辅助回归中只保留解释变量的线性项而剔除所有平方项和交叉项时,两者在形式上等价。
鉴于上述特点,实践中常将怀特检验与 Breusch-Pagan 检验结合使用,通过对比两者的检验结果来判断异方差的结构特征。
White 稳健标准误
值得一提的是,怀特在同一篇论文中还提出了与异方差检验相配套的 怀特稳健标准误 (White's Robust Standard Errors),也称为 异方差一致标准误 (Heteroscedasticity-Consistent Standard Errors, HC标准误)。该估计量的核心思想是直接利用 OLS 残差平方来估计协方差矩阵中的未知成分,从而在不改变参数估计值的前提下获得对异方差稳健的 标准误 估计,其表达式为:
其中 为 设计矩阵。这即著名的 三明治估计量 (Sandwich Estimator)。在实际应用中,即使怀特检验表明存在异方差性,研究者也不必立即转向 加权最小二乘法 (WLS) 或 广义最小二乘法 (GLS),而可以选择直接报告怀特稳健标准误,这在现代 应用计量经济学 中已成为标准做法。
主要应用场景
怀特检验在 经济学、金融学、社会学 和 生物统计学 等多个领域的实证研究中具有广泛的应用价值:
- 横截面数据分析:在利用横截面数据进行 多元回归分析 时,怀特检验是最常用的异方差诊断工具之一,涉及 劳动经济学 中的工资方程、产业组织 中的生产函数估计以及 发展经济学 中的增长回归等。
- 金融资产定价模型:在检验 CAPM、Fama-French 三因子模型 等资产定价模型时,股票收益率 的方差往往与公司规模、市净率 等特征变量相关,怀特检验可用于验证模型设定的合理性。
- 教育绩效评估:在分析 教育生产函数 (Education Production Function) 时,不同学校和班级的学生成绩变异程度差异较大,怀特检验为正确评估教育政策效果提供统计基础。
- 健康经济学研究:在 健康经济学 (Health Economics) 的医疗支出模型中,由于个体健康状况和医疗需求的异质性,误差项通常呈现出显著的异方差特征。
局限性与注意事项
尽管怀特检验具有无需预设函数形式的显著优势,但在实际应用中仍需注意以下问题:
- 小样本偏差:怀特检验本质上属于大样本检验,其 LM 统计量的 渐近分布 性质在样本量较小时可能失真,容易出现 第一类错误 (Type I Error) 膨胀的问题。建议在样本量 时谨慎使用。
- 自由度过度消耗:当模型中包含较多解释变量时,辅助回归引入大量平方项和交叉项,导致自由度迅速消耗,检验功效急剧下降。此时可考虑使用 怀特检验的简化形式 (White Test without Cross Terms),即仅保留平方项而剔除交叉项,以节省自由度。
- 对模型设定的敏感性:怀特检验的结论高度依赖于 模型设定 (Model Specification)。若 遗漏重要变量 或模型存在 函数形式误设 (Functional Form Misspecification),检验可能错误地归因于异方差性,导致误判。
- 无法识别异方差的具体来源:怀特检验只能给出是否存在异方差的整体判断,但无法指出异方差具体由哪个解释变量引起。若需进一步诊断,可结合 Goldfeld-Quandt 检验、Levene 检验 或残差图分析进行细化识别。
- 序贯检验问题:若在怀特检验发现异方差后直接以同一数据选择 加权最小二乘法 的权重形式,会涉及 预检验偏误 (Pre-test Bias),导致最终推断的 抽样分布 偏离理论分布。
软件实现
在主流统计软件中,怀特检验均有便捷的实现方式。在 R 语言中,\texttt{lmtest} 包的 \texttt{bptest()} 函数在设置 \texttt{studentize = FALSE} 并指定合适的辅助回归公式时可用于实现怀特检验,\texttt{car} 包的 \texttt{ncvTest()} 函数也可完成类似功能;在 Python 中,\texttt{statsmodels} 库的 \texttt{het\_white()} 函数直接提供了怀特检验的标准化接口;在 Stata 中,\texttt{estat imtest, white} 命令是最常用的调用方式;在 EViews 中,怀特检验是回归输出的标准诊断选项之一,可通过菜单操作直接获取检验结果。此外,绝大多数统计软件均支持直接输出 怀特稳健标准误,在 R 中可通过 \texttt{sandwich} 包的 \texttt{vcovHC()} 函数实现,在 Stata 中则通过 \texttt{robust} 选项调用。