误差项方差的无偏估计 (Unbiased Estimator of the Error Variance)
在统计学 与计量经济学 中,误差项方差的无偏估计 是指在线性回归模型 的框架下,对不可直接观测的误差项 (或扰动项)的方差 σ 2 \sigma^2 σ 2 进行估计的一种方法。该估计量通常记为 σ ^ 2 \hat{\sigma}^2 σ ^ 2 或 s 2 s^2 s 2 ,其构造保证了期望值 恰好等于真实的误差方差 σ 2 \sigma^2 σ 2 。它是进行假设检验 、构建置信区间 以及评估模型拟合优度 的核心组成部分。
标准的多重线性回归模型可以表示为:
Y i = β 0 + β 1 X i 1 + β 2 X i 2 + ⋯ + β k X i k + u i Y_i = \beta_0 + \beta_1 X_{i1} + \beta_2 X_{i2} + \dots + \beta_k X_{ik} + u_i Y i = β 0 + β 1 X i 1 + β 2 X i 2 + ⋯ + β k X ik + u i
其中 Y i Y_i Y i 是第 i i i 次观测的因变量 ,X i 1 , … , X i k X_{i1},\dots,X_{ik} X i 1 , … , X ik 是第 i i i 次观测的 k k k 个自变量 (解释变量),β 0 , β 1 , … , β k \beta_0,\beta_1,\dots,\beta_k β 0 , β 1 , … , β k 是模型的回归系数 (待估的未知参数),而 u i u_i u i 是第 i i i 次观测的误差项 ,代表了所有未被模型中的自变量所解释的、因变量 Y i Y_i Y i 的变异来源。
在经典线性模型 (Classical Linear Model, CLM) 的假设下,我们假定误差项的方差对所有观测都是常数,即同方差性 (Homoscedasticity) 假设:
V a r ( u i ) = σ 2 for all i = 1 , … , n \mathrm{Var}(u_i) = \sigma^2 \quad \text{for all } i=1,\dots,n Var ( u i ) = σ 2 for all i = 1 , … , n
由于真实的误差项 u i u_i u i 不可直接观测(它依赖于未知的真实系数 β j \beta_j β j ),我们无法直接计算其方差。因此,我们必须借助模型估计后得到的残差 (residuals) u ^ i \hat{u}_i u ^ i 来构造 σ 2 \sigma^2 σ 2 的一个估计量 。残差的定义是实际观测值与模型预测值之差:
u ^ i = Y i − Y ^ i = Y i − ( β ^ 0 + β ^ 1 X i 1 + ⋯ + β ^ k X i k ) \hat{u}_i = Y_i - \hat{Y}_i = Y_i - (\hat{\beta}_0 + \hat{\beta}_1 X_{i1} + \dots + \hat{\beta}_k X_{ik}) u ^ i = Y i − Y ^ i = Y i − ( β ^ 0 + β ^ 1 X i 1 + ⋯ + β ^ k X ik )
其中 β ^ j \hat{\beta}_j β ^ j 是通过普通最小二乘法 (Ordinary Least Squares, OLS) 得到的回归系数估计值。
自由度调整的必要性
一个很自然的想法是直接计算残差的样本方差来估计 σ 2 \sigma^2 σ 2 ,即:
σ ~ 2 = ∑ i = 1 n u ^ i 2 n = S S R n \tilde{\sigma}^2 = \frac{\sum_{i=1}^n \hat{u}_i^2}{n} = \frac{SSR}{n} σ ~ 2 = n ∑ i = 1 n u ^ i 2 = n SSR
其中 S S R = ∑ i = 1 n u ^ i 2 SSR = \sum_{i=1}^n \hat{u}_i^2 SSR = ∑ i = 1 n u ^ i 2 是残差平方和 (Sum of Squared Residuals)。然而,这个估计量 σ ~ 2 \tilde{\sigma}^2 σ ~ 2 是一个有偏估计量 (Biased Estimator)——它的期望值小于真实的 σ 2 \sigma^2 σ 2 ,即 E ( σ ~ 2 ) < σ 2 E(\tilde{\sigma}^2) < \sigma^2 E ( σ ~ 2 ) < σ 2 。
这种向下的偏误源于 OLS 估计的本质:OLS 选择一组系数 β ^ j \hat{\beta}_j β ^ j 使得残差平方和 S S R SSR SSR 最小化。该最小化过程导致残差 u ^ i \hat{u}_i u ^ i 在整体上比真实误差 u i u_i u i "更小",从而使 S S R SSR SSR 系统性地低估了真实误差的波动幅度。换言之,样本内残差的变异性总是小于总体误差项的变异性,因为模型对样本数据进行了"过度拟合"。
为了修正这种偏误,必须对分母进行调整。这一调整基于自由度 (Degrees of Freedom) 的概念。在多元回归中,虽有 n n n 个观测样本,但在估计模型参数时已"消耗"了一部分信息。具体而言,我们估计了 k + 1 k+1 k + 1 个参数(k k k 个斜率系数和 1 1 1 个截距项 β 0 \beta_0 β 0 )。因此,用于估计误差方差的有效信息量(即自由度)是 n − ( k + 1 ) n - (k+1) n − ( k + 1 ) 。每增加一个回归元,在计算方差估计时便需额外扣除一个自由度,这种扣除正是对 OLS 最小化过程所嵌入的参数约束的计数。
无偏估计量的公式
通过将残差平方和除以其对应的自由度,便得到误差项方差 σ 2 \sigma^2 σ 2 的无偏估计量 σ ^ 2 \hat{\sigma}^2 σ ^ 2 :
σ ^ 2 = ∑ i = 1 n u ^ i 2 n − k − 1 = S S R n − k − 1 \hat{\sigma}^2 = \frac{\sum_{i=1}^n \hat{u}_i^2}{n-k-1} = \frac{SSR}{n-k-1} σ ^ 2 = n − k − 1 ∑ i = 1 n u ^ i 2 = n − k − 1 SSR
该公式的数学性质为 E ( σ ^ 2 ) = σ 2 E(\hat{\sigma}^2) = \sigma^2 E ( σ ^ 2 ) = σ 2 ,即在大量重复抽样中,此估计量的平均值将精确等于真实的误差方差 σ 2 \sigma^2 σ 2 。这使其成为进行统计推断的重要前提。
特殊情况:简单线性回归 。对于仅包含一个自变量的简单线性回归 模型 Y i = β 0 + β 1 X i + u i Y_i = \beta_0 + \beta_1 X_i + u_i Y i = β 0 + β 1 X i + u i ,需要估计两个参数(β 0 \beta_0 β 0 和 β 1 \beta_1 β 1 ),故 k = 1 k=1 k = 1 。此时,误差项方差的无偏估计退化为:
σ ^ 2 = ∑ i = 1 n u ^ i 2 n − 2 \hat{\sigma}^2 = \frac{\sum_{i=1}^n \hat{u}_i^2}{n-2} σ ^ 2 = n − 2 ∑ i = 1 n u ^ i 2
这是几乎所有初级统计学课程都会介绍的经典形式,其分母为 n − 2 n-2 n − 2 而非 n n n 。
无偏性的数学证明
对 σ ^ 2 \hat{\sigma}^2 σ ^ 2 的无偏性进行严格证明需借助线性代数。证明的核心思路可概括为以下几个步骤。
第一,将残差向量 u ^ \hat{u} u ^ 表示为真实误差向量 u u u 的线性变换:u ^ = M u \hat{u} = M u u ^ = M u ,其中 M = I − X ( X ′ X ) − 1 X ′ M = I - X(X'X)^{-1}X' M = I − X ( X ′ X ) − 1 X ′ 是一个对称幂等矩阵,称为残差生成矩阵 或投影矩阵 (annihilator matrix)。该矩阵的重要意义在于它将因变量向量投影到设计矩阵 X X X 的列空间的正交补空间上。
第二,残差平方和 S S R SSR SSR 可以写作二次型:S S R = u ^ ′ u ^ = u ′ M ′ M u = u ′ M u SSR = \hat{u}'\hat{u} = u'M'Mu = u'Mu SSR = u ^ ′ u ^ = u ′ M ′ M u = u ′ M u 。由于 M M M 对称幂等,故 M ′ M = M M'M = M M ′ M = M 。
第三,计算 S S R SSR SSR 的期望值:E ( S S R ) = E ( u ′ M u ) E(SSR) = E(u'Mu) E ( SSR ) = E ( u ′ M u ) 。根据二次型 的期望公式,可得 E ( S S R ) = t r ( M ) σ 2 + E ( u ) ′ M E ( u ) E(SSR) = \mathrm{tr}(M)\sigma^2 + E(u)' M E(u) E ( SSR ) = tr ( M ) σ 2 + E ( u ) ′ ME ( u ) 。在 CLM 假设(误差项条件均值为零)下,E ( u ) = 0 E(u) = 0 E ( u ) = 0 ,因此交叉项消失,E ( S S R ) = t r ( M ) σ 2 E(SSR) = \mathrm{tr}(M)\sigma^2 E ( SSR ) = tr ( M ) σ 2 。
第四,计算矩阵 M M M 的迹 (trace)。利用迹的线性性与循环置换性质:
t r ( M ) = t r ( I ) − t r ( X ( X ′ X ) − 1 X ′ ) = n − t r ( ( X ′ X ) − 1 X ′ X ) = n − t r ( I k + 1 ) = n − ( k + 1 ) \mathrm{tr}(M) = \mathrm{tr}(I) - \mathrm{tr}(X(X'X)^{-1}X') = n - \mathrm{tr}((X'X)^{-1}X'X) = n - \mathrm{tr}(I_{k+1}) = n - (k+1) tr ( M ) = tr ( I ) − tr ( X ( X ′ X ) − 1 X ′ ) = n − tr (( X ′ X ) − 1 X ′ X ) = n − tr ( I k + 1 ) = n − ( k + 1 )
第五,将以上结果综合,得到 E ( S S R ) = ( n − k − 1 ) σ 2 E(SSR) = (n-k-1)\sigma^2 E ( SSR ) = ( n − k − 1 ) σ 2 。最后,计算 σ ^ 2 \hat{\sigma}^2 σ ^ 2 的期望值:
E ( σ ^ 2 ) = E ( S S R n − k − 1 ) = E ( S S R ) n − k − 1 = ( n − k − 1 ) σ 2 n − k − 1 = σ 2 E(\hat{\sigma}^2) = E\left(\frac{SSR}{n-k-1}\right) = \frac{E(SSR)}{n-k-1} = \frac{(n-k-1)\sigma^2}{n-k-1} = \sigma^2 E ( σ ^ 2 ) = E ( n − k − 1 SSR ) = n − k − 1 E ( SSR ) = n − k − 1 ( n − k − 1 ) σ 2 = σ 2
这就严格证明了 σ ^ 2 \hat{\sigma}^2 σ ^ 2 是 σ 2 \sigma^2 σ 2 的一个无偏估计量 。值得注意的是,该证明仅依赖于误差项的零均值假设与同方差假设,不涉及误差项的具体分布形式。这也意味着,只要经典线性模型的 Gauss-Markov 假设成立,无论误差项是否服从正态分布,σ ^ 2 \hat{\sigma}^2 σ ^ 2 始终是 σ 2 \sigma^2 σ 2 的无偏估计。
估计量的应用与重要性
回归标准误 (Standard Error of the Regression, SER) 。σ ^ 2 \hat{\sigma}^2 σ ^ 2 的正平方根,即 σ ^ \hat{\sigma} σ ^ ,称为回归标准误 :
σ ^ = S S R n − k − 1 \hat{\sigma} = \sqrt{\frac{SSR}{n-k-1}} σ ^ = n − k − 1 SSR
SER 度量了样本数据点偏离回归线的平均距离,是评估模型拟合优度的重要指标。它的单位与因变量 Y Y Y 相同,因此具有直观的经济含义——它告诉研究者模型中无法解释的随机成分的典型幅度。SER 也被称为均方根误差 (Root Mean Squared Error, RMSE),但需注意不同软件对 RMSE 的定义存在差异:部分软件使用 n n n 而非 n − k − 1 n-k-1 n − k − 1 作为分母。
系数估计量的方差--协方差矩阵 。在 CLM 假设下,OLS 估计量 β ^ \hat{\beta} β ^ 的方差--协方差矩阵为:
V a r ( β ^ ) = σ 2 ( X ′ X ) − 1 \mathrm{Var}(\hat{\beta}) = \sigma^2 (X'X)^{-1} Var ( β ^ ) = σ 2 ( X ′ X ) − 1
由于 σ 2 \sigma^2 σ 2 未知,我们使用其无偏估计 σ ^ 2 \hat{\sigma}^2 σ ^ 2 来估计该矩阵:
V a r ( β ^ ) ^ = σ ^ 2 ( X ′ X ) − 1 \widehat{\mathrm{Var}(\hat{\beta})} = \hat{\sigma}^2 (X'X)^{-1} Var ( β ^ ) = σ ^ 2 ( X ′ X ) − 1
该矩阵对角线元素的平方根即为各回归系数 β ^ j \hat{\beta}_j β ^ j 的标准误 (Standard Errors)。标准误是衡量估计量精度的关键指标,直接影响假设检验和置信区间构建的结果。
统计推断的基础 。没有 σ ^ 2 \hat{\sigma}^2 σ ^ 2 ,就无法计算回归系数的标准误,进而无法进行 t 检验(检验单个系数的显著性 )、F 检验(检验模型的整体显著性或多个系数的线性约束),也无法构建回归系数的置信区间。因此,σ ^ 2 \hat{\sigma}^2 σ ^ 2 是所有标准回归推断的基石。在异方差存在时,虽需使用稳健标准误 (如 Huber-White 标准误)替代普通标准误,但无偏估计量 σ ^ 2 \hat{\sigma}^2 σ ^ 2 的构造理念仍是理解各类稳健方差估计的基础。此外,σ ^ 2 \hat{\sigma}^2 σ ^ 2 在信息准则(如 AIC、BIC)和模型选择中亦扮演着重要角色,因为这些准则通常需要基于残差方差来平衡模型拟合优度与参数复杂度。
Bessel 修正与更广阔的视角
误差项方差的无偏估计中所涉及的自由度调整,本质上是Bessel 修正 (Bessel's correction) 在多元回归框架下的推广。在单样本情境中,样本方差的分母为 n − 1 n-1 n − 1 ;在回归情境中,由于需要估计 k + 1 k+1 k + 1 个参数,分母相应地变为 n − k − 1 n-k-1 n − k − 1 。这一思想贯穿于整个统计学:凡涉及用样本残差估计总体方差之处,均需根据已消耗的自由度对分母进行调整。理解这一修正机制,有助于更深刻地把握统计推断中"自由度"概念的精髓——它不仅是数学公式中的数字,更代表了数据为参数估计所付出的"信息代价"。