无完全多重共线性
无完全多重共线性 (No Perfect Multicollinearity)
无完全多重共线性是线性回归模型中高斯-马尔可夫定理(Gauss-Markov Theorem)的核心假设之一。它要求模型的解释变量之间不存在精确的线性关系,即没有任何一个解释变量可以被其他解释变量的线性组合精确表示。在数学上,该假设等价于设计矩阵 (,含常数项列)为满列秩(full column rank),即 。由此,矩阵 是非奇异的、可逆的,从而保证普通最小二乘法(OLS)的估计量 存在且唯一。
形式化定义
设有 个解释变量 (含截距项对应的常数列)。完全多重共线性(perfect multicollinearity)指存在一组不全为零的常数 ,使得对所有样本观测值 ,均有:
若不存在任何此类非零线性组合,则称数据满足无完全多重共线性的假设。该条件等价于 可逆,或者说 的所有特征值严格大于零。
常见违反情形
完全多重共线性在实证中通常由人为疏忽或数据结构设计导致,而非随机现象。典型情形包括:
虚拟变量陷阱(dummy variable trap):当使用一组互斥且穷尽的类别虚拟变量时,若同时包含所有类别虚拟变量和截距项,则各虚拟变量之和恒等于 1(即截距项),产生精确的线性依赖。正确做法是省略一个基准类别。
变量间的恒等关系:如模型同时包含年龄、出生年份和当前年份,其中任一个可由另两个线性表出。又如同时放入总收入与分项收入之和。
样本量不足:当解释变量个数 超过样本量 ()时, 不可能满列秩,秩最多为 ,必然违反无完全多重共线性假设。
与不完全多重共线性的区别
不完全多重共线性(imperfect multicollinearity)指解释变量之间存在高度但非精确的线性相关。此时 仍可逆,OLS 估计量无偏的且一致性成立,但其方差被严重放大,导致t统计量不显著、系数估计对样本微小变化极为敏感。无完全多重共线性保证的是估计量存在性,而多重共线性程度影响的是估计量的精度。实践中,完全多重共线性使 OLS 无法计算(软件报错矩阵奇异),而不完全多重共线性虽能计算但估计质量下降。
诊断与检验
完全多重共线性的诊断相对直接:若 的行列式为零或接近零,或存在零特征值,即表明完全或接近完全的共线性。对于不完全多重共线性,常用诊断工具包括方差膨胀因子(VIF):第 个解释变量的 ,其中 为将 对其余解释变量回归的决定系数。经验规则为 VIF 大于 10 表明严重共线性;条件数(condition number),即 最大与最小特征值之比的平方根,大于 30 时需警惕。
在计量经济学中的地位
无完全多重共线性与误差项的零条件均值假设、同方差性及无自相关共同构成高斯-马尔可夫定理的条件。这些假设联合保证了 OLS 是最佳线性无偏估计量(BLUE)。然而,无完全多重共线性是所有假设中最具"技术性"的一个:它不涉及任何随机性假设,仅对样本数据的结构提出要求,且在实践中几乎总是可以通过恰当的数据预处理(如移除冗余变量、设置基准类别)予以满足。当因多重共线性导致估计不稳定时,可考虑岭回归、主成分回归或增加样本量。在面板数据模型中,固定效应与不随时间变化的变量也可能产生完全共线性,需在模型设定时格外留意。