知经百科 / Z

最小二乘估计的方差-协方差矩阵

最小二乘估计的方差-协方差矩阵 (Variance-Covariance Matrix of OLS Estimators)

最小二乘估计的方差-协方差矩阵,在计量经济学统计学中,是一个核心概念,用于衡量通过普通最小二乘法 (Ordinary Least Squares, OLS) 得到的参数估计量的不确定性和相关性。该矩阵通常被记为 Var(β^)\text{Var}(\hat{\beta})Σβ^\Sigma_{\hat{\beta}}

具体而言,这是一个对称的方阵,其对角线上的元素是各个回归系数估计量的方差 (variance),而非对角线上的元素是不同回归系数估计量之间的协方差 (covariance)。理解这个矩阵对于进行假设检验、构建置信区间以及评估整个回归模型的可靠性至关重要。

理论基础与背景

在标准的多元线性回归模型中,我们有如下矩阵形式的表达式:

Y=Xβ+ϵY = X\beta + \epsilon

其中:

  • YY 是一个 n×1n \times 1 的因变量观测值向量。
  • XX 是一个 n×(k+1)n \times (k+1) 的设计矩阵,包含了自变量的观测值以及一个常数项列。
  • β\beta 是一个 (k+1)×1(k+1) \times 1 的未知参数向量,代表真实的回归系数。
  • ϵ\epsilon 是一个 n×1n \times 1 的误差项向量。

普通最小二乘法 (OLS) 的目标是找到一个参数估计向量 β^\hat{\beta},使得残差平方和 ee=(YXβ^)(YXβ^)e'e = (Y - X\hat{\beta})'(Y - X\hat{\beta}) 最小化。通过求解这个最小化问题,我们得到 OLS 估计量:

β^=(XX)1XY\hat{\beta} = (X'X)^{-1}X'Y

由于 YY 是一个随机变量(因为它包含了随机误差项 ϵ\epsilon),所以 β^\hat{\beta} 也是一个随机向量。因此,我们可以讨论它的期望、方差和协方差。

方差-协方差矩阵的推导

为了推导出 Var(β^)\text{Var}(\hat{\beta}),我们首先需要知道 β^\hat{\beta}期望 E[β^]E[\hat{\beta}]。这一步同时可以证明 OLS 估计量的无偏性

1. 证明无偏性 (Unbiasedness)

我们假设解释变量矩阵 XX 是非随机的(或在推导中以 XX为条件),并且误差项的期望为零,即 E[ϵX]=0E[\epsilon | X] = 0

E[β^]=E[(XX)1XYX]=E[(XX)1X(Xβ+ϵ)X]=E[(XX)1XXβ+(XX)1XϵX]=(XX)1XXβ+(XX)1XE[ϵX]=Iβ+(XX)1X0=β\begin{aligned} E[\hat{\beta}] &= E[(X'X)^{-1}X'Y | X] \\ &= E[(X'X)^{-1}X'(X\beta + \epsilon) | X] \\ &= E[(X'X)^{-1}X'X\beta + (X'X)^{-1}X'\epsilon | X] \\ &= (X'X)^{-1}X'X\beta + (X'X)^{-1}X'E[\epsilon | X] \\ &= I\beta + (X'X)^{-1}X' \cdot 0 \\ &= \beta \end{aligned}

这个结果表明,OLS 估计量 β^\hat{\beta} 是真实参数 β\beta 的一个无偏估计量

2. 推导方差-协方差矩阵

方差-协方差矩阵的定义为 Var(β^)=E[(β^E[β^])(β^E[β^])]\text{Var}(\hat{\beta}) = E[(\hat{\beta} - E[\hat{\beta}])(\hat{\beta} - E[\hat{\beta}])']。由于 E[β^]=βE[\hat{\beta}] = \beta,我们可以得到:

β^β=(XX)1XYβ=(XX)1X(Xβ+ϵ)β=(XX)1Xϵ\hat{\beta} - \beta = (X'X)^{-1}X'Y - \beta = (X'X)^{-1}X'(X\beta + \epsilon) - \beta = (X'X)^{-1}X'\epsilon

因此,

Var(β^)=E[(β^β)(β^β)X]=E[((XX)1Xϵ)((XX)1Xϵ)X]=E[(XX)1XϵϵX(XX)1X]=(XX)1XE[ϵϵX]X(XX)1\begin{aligned} \text{Var}(\hat{\beta}) &= E[(\hat{\beta} - \beta)(\hat{\beta} - \beta)' | X] \\ &= E[\left((X'X)^{-1}X'\epsilon\right)\left((X'X)^{-1}X'\epsilon\right)' | X] \\ &= E[(X'X)^{-1}X'\epsilon\epsilon'X(X'X)^{-1} | X] \\ &= (X'X)^{-1}X' E[\epsilon\epsilon' | X] X(X'X)^{-1} \end{aligned}

此时,我们需要引入关于误差项方差和协方差的高斯-马尔可夫定理(Gauss-Markov)中的核心假设:

  • 同方差性 (Homoscedasticity):所有误差项具有相同的方差,即 E[ϵi2X]=σ2E[\epsilon_i^2 | X] = \sigma^2 对所有 ii 成立。
  • 自相关 (No Autocorrelation):不同观测值的误差项之间不相关,即 E[ϵiϵjX]=0E[\epsilon_i \epsilon_j | X] = 0 对所有 iji \neq j 成立。

这两个假设可以统一用矩阵形式表示为:

E[ϵϵX]=σ2InE[\epsilon\epsilon' | X] = \sigma^2 I_n

其中,InI_n 是一个 n×nn \times n单位矩阵

将这个假设代入我们之前的推导中:

Var(β^)=(XX)1X(σ2In)X(XX)1=σ2(XX)1XX(XX)1=σ2(Ik+1)(XX)1=σ2(XX)1\begin{aligned} \text{Var}(\hat{\beta}) &= (X'X)^{-1}X' (\sigma^2 I_n) X(X'X)^{-1} \\ &= \sigma^2 (X'X)^{-1}X'X(X'X)^{-1} \\ &= \sigma^2 (I_{k+1})(X'X)^{-1} \\ &= \sigma^2 (X'X)^{-1} \end{aligned}

这就是 OLS 估计量的方差-协方差矩阵的经典公式。

矩阵的结构与解读

假设一个包含截距项和 kk 个自变量的回归模型,β^=[β^0,β^1,,β^k]\hat{\beta} = [\hat{\beta}_0, \hat{\beta}_1, \dots, \hat{\beta}_k]'。其方差-协方差矩阵是一个 (k+1)×(k+1)(k+1) \times (k+1) 的方阵:

Var(β^)=σ2(XX)1=(Var(β^0)Cov(β^0,β^1)Cov(β^0,β^k)Cov(β^1,β^0)Var(β^1)Cov(β^1,β^k)Cov(β^k,β^0)Cov(β^k,β^1)Var(β^k))\text{Var}(\hat{\beta}) = \sigma^2(X'X)^{-1} = \begin{pmatrix} \text{Var}(\hat{\beta}_0) & \text{Cov}(\hat{\beta}_0, \hat{\beta}_1) & \cdots & \text{Cov}(\hat{\beta}_0, \hat{\beta}_k) \\ \text{Cov}(\hat{\beta}_1, \hat{\beta}_0) & \text{Var}(\hat{\beta}_1) & \cdots & \text{Cov}(\hat{\beta}_1, \hat{\beta}_k) \\ \vdots & \vdots & \ddots & \vdots \\ \text{Cov}(\hat{\beta}_k, \hat{\beta}_0) & \text{Cov}(\hat{\beta}_k, \hat{\beta}_1) & \cdots & \text{Var}(\hat{\beta}_k) \end{pmatrix}
  • 对角线元素 (Diagonal Elements)Var(β^j)\text{Var}(\hat{\beta}_j) 是第 jj 个系数估计量 β^j\hat{\beta}_j 的方差。它衡量了 β^j\hat{\beta}_j 围绕其真实值 βj\beta_j 的离散程度。其平方根被称为该系数的标准误 (Standard Error),即 se(β^j)=Var(β^j)\text{se}(\hat{\beta}_j) = \sqrt{\text{Var}(\hat{\beta}_j)}。标准误越小,估计越精确。
  • 非对角线元素 (Off-Diagonal Elements)Cov(β^i,β^j)\text{Cov}(\hat{\beta}_i, \hat{\beta}_j) 是两个不同系数估计量 β^i\hat{\beta}_iβ^j\hat{\beta}_j 之间的协方差。它衡量了这两个估计量如何协同变化。如果协方差为正,表示当 β^i\hat{\beta}_i 的抽样值高于其均值 βi\beta_i 时,β^j\hat{\beta}_j 的抽样值也倾向于高于其均值 βj\beta_j。非零的协方差通常是由自变量之间的多重共线性 (Multicollinearity) 引起的。如果自变量 XiX_iXjX_j 高度相关,那么 β^i\hat{\beta}_iβ^j\hat{\beta}_j 的协方差绝对值通常也会很大。

实际应用中的估计

在现实中,真实的误差方差 σ2\sigma^2 是未知的。因此,我们需要使用数据对其进行估计。σ2\sigma^2 的一个无偏估计量是:

σ^2=een(k+1)=i=1nei2nk1\hat{\sigma}^2 = \frac{e'e}{n-(k+1)} = \frac{\sum_{i=1}^{n} e_i^2}{n-k-1}

其中 e=YXβ^e = Y - X\hat{\beta}残差向量,nn 是样本量,k+1k+1 是被估计的参数数量(包括截距项)。分母 nk1n-k-1 是模型的自由度

σ^2\hat{\sigma}^2 替换未知的 σ2\sigma^2,我们得到估计的方差-协方差矩阵

Var(β^)^=σ^2(XX)1\widehat{\text{Var}(\hat{\beta})} = \hat{\sigma}^2(X'X)^{-1}

这个矩阵是所有标准统计软件(如 R, Stata, Python's statsmodels)在输出 OLS 回归结果时计算和使用的。系数的标准误就是从这个矩阵的对角线元素的平方根得到的。

重要性与应用

  • 假设检验 (Hypothesis Testing):对单个系数的 t-检验 严重依赖于标准误。例如,要检验 H0:βj=0H_0: \beta_j=0,我们计算 t-统计量 t=β^j/se(β^j)t = \hat{\beta}_j / \text{se}(\hat{\beta}_j),其中的分母直接来自该矩阵。对多个系数的联合检验,如 F-检验,其计算公式更复杂,但同样根植于整个方差-协方差矩阵的结构。
  • 置信区间 (Confidence Intervals)βj\beta_j 的置信区间为 β^j±tα/2se(β^j)\hat{\beta}_j \pm t_{\alpha/2} \cdot \text{se}(\hat{\beta}_j),其宽度直接由标准误决定。
  • 诊断问题:当模型存在严重的多重共线性时,(XX)1(X'X)^{-1} 矩阵的对角线元素会变得非常大,从而导致估计量的方差和标准误膨胀。这降低了估计的精确性,使得我们难以对系数的真实影响做出可靠的推断。

当经典假设不成立时

上述推导依赖于 E[ϵϵX]=σ2InE[\epsilon\epsilon' | X] = \sigma^2 I_n 的假设。如果这个假设被违背(例如存在异方差性或自相关),σ2(XX)1\sigma^2(X'X)^{-1} 将不再是 Var(β^)\text{Var}(\hat{\beta}) 的正确表达式。使用它会导致错误的标准误和无效的统计推断(t检验、F检验等)。

  • 异方差性 (Heteroscedasticity):当误差项的方差随观测值变化时,Var(β^)\text{Var}(\hat{\beta}) 的正确形式变为所谓的"三明治估计量" (Sandwich Estimator)。在这种情况下,研究者通常会使用异方差-稳健标准误(如 White's standard errors)。
  • 自相关 (Autocorrelation):在时间序列数据中,误差项常常是相关的。此时,需要使用异方差和自相关稳健标准误(HAC standard errors,如 Newey-West standard errors)来进行有效的统计推断。

返回百科索引