知经百科 / Y

样本正交

样本正交 (Sample Orthogonality)

样本正交 (Sample Orthogonality) 是计量经济学统计学中描述样本数据之间几何关系的重要概念。在经典的最小二乘法 (OLS) 框架下,样本正交特指残差向量拟合值向量之间的正交关系,以及残差向量与各解释变量样本观测向量之间的正交关系。这一性质并非来自统计假设,而是OLS估计量的纯代数结果,无论模型设定正确与否,它始终成立。

定义与数学表达

设有线性回归模型:

Y=Xβ+ϵY = X\beta + \epsilon

其中 YYn×1n \times 1被解释变量样本向量,XXn×kn \times k 的解释变量样本矩阵(通常含第一列全为1的常数项),β\betak×1k \times 1 的系数向量,ϵ\epsilon 是误差项。OLS估计量 β^=(XX)1XY\hat{\beta} = (X'X)^{-1}X'Y 产生的残差向量为 e=YXβ^e = Y - X\hat{\beta}拟合值向量为 Y^=Xβ^\hat{Y} = X\hat{\beta}

样本正交的核心结果为两个等式:

Xe=0,Y^e=0X'e = 0, \quad \hat{Y}'e = 0

前者表明残差向量与每一个解释变量样本向量正交(包括常数项向量,即残差之和为零 ei=0\sum e_i = 0);后者是前者的直接推论——因为 Y^e=β^Xe=β^0=0\hat{Y}'e = \hat{\beta}'X'e = \hat{\beta}' \cdot 0 = 0。当模型中包含常数项时,残差之和自动为零,这意味着残差向量的样本均值恒为零,这是OLS区别于其他估计方法的一个独特代数特征。

几何直观

将样本观测视为 nn 维空间中的向量:YY 是一个 nn 维向量,解释变量矩阵 XX 的列向量张成一个 kk 维子空间 C(X)C(X)(即列空间)。OLS的本质是在该子空间中寻找与 YY 距离最近的点,该点即为拟合值 Y^\hat{Y}。连接 YYY^\hat{Y} 的向量正是残差 e=YY^e = Y - \hat{Y}

由最小距离的几何性质可知,ee 必须垂直于子空间 C(X)C(X) 中的每一个向量,亦即 eeXX 的每一列正交(Xe=0X'e = 0)。将这一关系投影到拟合值的视角:由于 Y^\hat{Y} 属于 C(X)C(X),故 ee 必然垂直于 Y^\hat{Y}Y^e=0\hat{Y}'e = 0)。

从几何角度看,OLS估计本质上就是一次正交投影操作。将向量 YY 分解为相互正交的两个分量——位于回归平面上的 Y^\hat{Y} 和垂直于回归平面的 ee——是理解线性回归最直观的思维模型。这一正交分解不依赖于任何概率分布假设,因此无论数据由何种机制生成,只要使用OLS,分解就自动成立。

投影矩阵视角

定义投影矩阵(帽子矩阵)为 P=X(XX)1XP = X(X'X)^{-1}X',则 Y^=PY\hat{Y} = PY,残差 e=(IP)Ye = (I - P)Y。矩阵 PP幂等矩阵P2=PP^2 = P)且对称。正交性可由投影矩阵直接验证:

Y^e=YP(IP)Y=Y(PP2)Y=0\hat{Y}'e = Y'P(I - P)Y = Y'(P - P^2)Y = 0

这一代数关系不依赖于 YY 的分布、误差项的同方差性或正态性等任何统计假设——它仅仅是OLS极小化残差平方和的必然结果。换言之,即使模型存在设定偏误(如遗漏变量、错误的函数形式),样本正交性在代数层面依然严格成立。

样本正交与方差分解

样本正交直接导致了OLS中最重要的方差分解关系:

TSS=ESS+RSS\text{TSS} = \text{ESS} + \text{RSS}

即总平方和((YiYˉ)2\sum (Y_i - \bar{Y})^2)等于解释平方和((Y^iYˉ)2\sum (\hat{Y}_i - \bar{Y})^2)加上残差平方和(ei2\sum e_i^2)。这是因为:

(YiYˉ)2=(Y^iYˉ)2+ei2+2(Y^iYˉ)ei\sum (Y_i - \bar{Y})^2 = \sum (\hat{Y}_i - \bar{Y})^2 + \sum e_i^2 + 2\sum (\hat{Y}_i - \bar{Y})e_i

而交叉项 (Y^iYˉ)ei=Y^eYˉei=00=0\sum (\hat{Y}_i - \bar{Y})e_i = \hat{Y}'e - \bar{Y}\sum e_i = 0 - 0 = 0,恰好依赖于样本正交性。

由此可得决定系数的定义:

R2=ESSTSS=1RSSTSSR^2 = \frac{\text{ESS}}{\text{TSS}} = 1 - \frac{\text{RSS}}{\text{TSS}}

这一分解在ANOVA表中构成了F检验的基础。在回归分析的方差分析表中,ESS对应回归平方和(即由模型解释的变异),RSS对应残差平方和(即未被模型解释的变异),二者的比例关系直接反映了模型的整体解释力。

样本正交与其他概念的联系

样本正交与以下重要概念密切相关:

  • 正交投影:OLS估计量正是被解释变量向量在解释变量列空间上的正交投影。
  • 残差与拟合值正交:这是样本正交在回归分析中最直接的表现形式。
  • 高斯-马尔可夫定理:该定理保证了OLS在线性无偏估计类中的最优性,而样本正交是推导OLS方差公式的关键中间步骤。
  • Frisch-Waugh-Lovell定理:该定理揭示了在多元回归中,某一特定系数的估计等价于先将该解释变量对其他所有解释变量回归取残差,再将 YY 对其他所有解释变量回归取残差,最后对这两个残差向量做简单回归——这本质上依赖于样本的正交分解。
  • ANOVA表:方差分析表的核心就是基于TSS、ESS、RSS的正交分解来构建F检验统计量。
  • 正交化格拉姆-施密特正交化等算法通过构造正交基来实现高效计算,这一思想在计量经济学中表现为FWL定理所揭示的逐步回归技巧。

更一般的正交条件

样本正交的概念可以推广到更广泛的估计框架中。在广义矩估计 (GMM) 中,估计量通过设定一组矩条件 E[g(Y,X,θ)]=0E[g(Y, X, \theta)] = 0 来定义,其中样本矩的正交性直接决定了估计的一致性。在工具变量法 (IV) 中,工具变量 ZZ 与误差项的正交条件 E(Zϵ)=0E(Z'\epsilon) = 0 是识别的基础。这些方法虽然不再要求残差与拟合值在样本层面严格正交,但正交性作为识别和估计的核心逻辑一以贯之。

此外,在时间序列分析中,ARMA模型的残差诊断也依赖于样本正交的思想——如果模型设定正确,样本残差与其滞后值之间的自相关函数应近似为零,这正是样本正交在平稳时间序列语境下的自然延伸。

重要区分

需要注意,样本正交所指的残差 ee 与拟合值 Y^\hat{Y} 的正交性可观测的代数性质,它并不等同于不可观测的误差项 ϵ\epsilon 与解释变量 XX 的正交性(即 E(Xϵ)=0E(X'\epsilon) = 0)。后者是保证OLS一致性的外生性假设,属于统计假设而非代数恒等式。若外生性不满足(如存在内生性问题),样本正交性质依然成立(因为OLS算法仍然会机械地使 Xe=0X'e = 0),但此时 β^\hat{\beta} 不再具有无偏性一致性。这一区分对于理解工具变量法广义矩估计 (GMM) 的逻辑尤为重要。

从实践角度看,理解样本正交与误差项正交的区别有助于避免常见的计量经济学误解。许多初学者误认为OLS残差与解释变量正交意味着解释变量是外生的,然而事实上这一正交性只是算法层面的产物,与因果识别的外生性要求有本质不同。正确区分这两者,是掌握现代计量经济学方法论的关键一步。

返回百科索引