自变量观测向量
自变量观测向量 (Vector of Observations on Independent Variables)是线性回归模型 中用于描述第 i i i 个观测样本的所有自变量的列向量,通常记为 x i \mathbf{x}_i x i 。在经典回归模型 y i = x i ′ β + ε i y_i = \mathbf{x}_i' \boldsymbol{\beta} + \varepsilon_i y i = x i ′ β + ε i 中,x i \mathbf{x}_i x i 被视为设计矩阵 X \mathbf{X} X 的第 i i i 行(以列向量转置参与运算),其元素构成了因变量 y i y_i y i 的线性预测因子。该向量既承载了模型设定的函数形式,也直接决定了参数估计、统计推断与预测评估的代数结构。
定义与符号约定
对于包含 k k k 个自变量(解释变量)的多重线性回归模型,当收集到 n n n 组独立同分布样本 { ( y i , x i 1 , x i 2 , … , x i k ) } i = 1 n \{ (y_i, x_{i1}, x_{i2}, \dots, x_{ik}) \}_{i=1}^n {( y i , x i 1 , x i 2 , … , x ik ) } i = 1 n 后,第 i i i 个观测的自变量观测向量定义为:
x i = ( 1 , x i 1 , x i 2 , … , x i k ) ′ ∈ R k + 1 \mathbf{x}_i = (1, x_{i1}, x_{i2}, \dots, x_{ik})' \in \mathbb{R}^{k+1} x i = ( 1 , x i 1 , x i 2 , … , x ik ) ′ ∈ R k + 1
其中第一个元素固定为 1,对应截距项 β 0 \beta_0 β 0 。所有观测的自变量观测向量按行堆叠即构成设计矩阵 (Design Matrix)X \mathbf{X} X :
X = ( x 1 ′ x 2 ′ ⋮ x n ′ ) \mathbf{X} =
\begin{pmatrix}
\mathbf{x}_1' \\
\mathbf{x}_2' \\
\vdots \\
\mathbf{x}_n'
\end{pmatrix} X = x 1 ′ x 2 ′ ⋮ x n ′
=
公式暂不可显示
\]
在矩阵表示的回归模型 y = X β + ε \mathbf{y} = \mathbf{X} \boldsymbol{\beta} + \boldsymbol{\varepsilon} y = X β + ε 中,y \mathbf{y} y 为因变量观测向量(n × 1 n \times 1 n × 1 ),β = ( β 0 , β 1 , … , β k ) ′ \boldsymbol{\beta} = (\beta_0, \beta_1, \dots, \beta_k)' β = ( β 0 , β 1 , … , β k ) ′ 为参数向量,ε \boldsymbol{\varepsilon} ε 为误差向量。x i ′ \mathbf{x}_i' x i ′ 作为 X \mathbf{X} X 的第 i i i 行,负责将参数向量映射到第 i i i 个观测的线性预测值 y ^ i = x i ′ β ^ \hat{y}_i = \mathbf{x}_i' \hat{\boldsymbol{\beta}} y ^ i = x i ′ β ^ 。该向量是联系个体观测数据与总体参数之间的基本桥梁。
在OLS估计中的核心作用
普通最小二乘法 (OLS)是求解回归参数的标准方法,自变量观测向量在其中扮演核心角色。
正规方程的导出
OLS 的目标是极小化残差平方和 ∑ i = 1 n ( y i − x i ′ β ) 2 \sum_{i=1}^n (y_i - \mathbf{x}_i' \boldsymbol{\beta})^2 ∑ i = 1 n ( y i − x i ′ β ) 2 。取梯度并令其为零,得到一阶条件:
∂ ∂ β ∑ i = 1 n ( y i − x i ′ β ) 2 = − 2 ∑ i = 1 n x i ( y i − x i ′ β ) = 0 \frac{\partial}{\partial \boldsymbol{\beta}} \sum_{i=1}^n (y_i - \mathbf{x}_i' \boldsymbol{\beta})^2 = -2 \sum_{i=1}^n \mathbf{x}_i (y_i - \mathbf{x}_i' \boldsymbol{\beta}) = 0 ∂ β ∂ i = 1 ∑ n ( y i − x i ′ β ) 2 = − 2 i = 1 ∑ n x i ( y i − x i ′ β ) = 0
即自变量观测向量与残差的正交关系:
∑ i = 1 n x i ( y i − x i ′ β ^ ) = 0 \sum_{i=1}^n \mathbf{x}_i (y_i - \mathbf{x}_i' \hat{\boldsymbol{\beta}}) = 0 i = 1 ∑ n x i ( y i − x i ′ β ^ ) = 0
写成矩阵形式即 X ′ ( y − X β ^ ) = 0 \mathbf{X}' (\mathbf{y} - \mathbf{X} \hat{\boldsymbol{\beta}}) = \mathbf{0} X ′ ( y − X β ^ ) = 0 ,得到正规方程 (Normal Equations):
X ′ X β ^ = X ′ y \mathbf{X}' \mathbf{X} \hat{\boldsymbol{\beta}} = \mathbf{X}' \mathbf{y} X ′ X β ^ = X ′ y
当 X ′ X \mathbf{X}' \mathbf{X} X ′ X 可逆(即设计矩阵列满秩)时,OLS估计量的闭式解为:
β ^ = ( X ′ X ) − 1 X ′ y \hat{\boldsymbol{\beta}} = (\mathbf{X}' \mathbf{X})^{-1} \mathbf{X}' \mathbf{y} β ^ = ( X ′ X ) − 1 X ′ y
该表达式中,X ′ X \mathbf{X}' \mathbf{X} X ′ X 是各对自变量观测向量的内积矩阵,其可逆性等价于不存在严格的多重共线性。
高斯-马尔可夫定理
高斯-马尔可夫定理 (Gauss-Markov Theorem)确立了OLS在线性无偏估计类中的最优性。在给定自变量观测矩阵 X \mathbf{X} X 的条件下,若误差项满足零条件均值(E [ ε ∣ X ] = 0 \mathbb{E}[\boldsymbol{\varepsilon} \mid \mathbf{X}] = 0 E [ ε ∣ X ] = 0 )和同方差性(Var [ ε ∣ X ] = σ 2 I n \operatorname{Var}[\boldsymbol{\varepsilon} \mid \mathbf{X}] = \sigma^2 \mathbf{I}_n Var [ ε ∣ X ] = σ 2 I n ),则在所有线性无偏估计量中,OLS估计量 β ^ = ( X ′ X ) − 1 X ′ y \hat{\boldsymbol{\beta}} = (\mathbf{X}' \mathbf{X})^{-1} \mathbf{X}' \mathbf{y} β ^ = ( X ′ X ) − 1 X ′ y 的方差最小,即BLUE(Best Linear Unbiased Estimator)。该定理不依赖于具体的分布假设,仅依赖于自变量观测向量的二阶矩结构。
帽子矩阵与杠杆值
自变量观测向量还定义了OLS的几何投影解释。帽子矩阵(Hat Matrix)为:
H = X ( X ′ X ) − 1 X ′ \mathbf{H} = \mathbf{X} (\mathbf{X}' \mathbf{X})^{-1} \mathbf{X}' H = X ( X ′ X ) − 1 X ′
其对角元 h i i = x i ′ ( X ′ X ) − 1 x i h_{ii} = \mathbf{x}_i' (\mathbf{X}' \mathbf{X})^{-1} \mathbf{x}_i h ii = x i ′ ( X ′ X ) − 1 x i 度量第 i i i 个观测的"杠杆值"(Leverage),反映了该观测的自变量取值在参数估计中的影响力。高杠杆点(通常以 h i i > 2 ( k + 1 ) / n h_{ii} > 2(k+1)/n h ii > 2 ( k + 1 ) / n 为预警阈值)对回归系数的拟合具有不成比例的影响,是回归诊断中识别异常观测的重要指标。杠杆值的和为 ∑ i = 1 n h i i = k + 1 \sum_{i=1}^n h_{ii} = k+1 ∑ i = 1 n h ii = k + 1 ,即参数个数,这意味着杠杆值在不同观测间呈零和博弈式的分布。
预测与区间估计
给定新的自变量观测向量 x new \mathbf{x}_{\text{new}} x new (已包含截距项1),OLS的条件期望 预测(点预测)为:
y ^ new = x new ′ β ^ = x new ′ ( X ′ X ) − 1 X ′ y \hat{y}_{\text{new}} = \mathbf{x}_{\text{new}}' \hat{\boldsymbol{\beta}} = \mathbf{x}_{\text{new}}' (\mathbf{X}' \mathbf{X})^{-1} \mathbf{X}' \mathbf{y} y ^ new = x new ′ β ^ = x new ′ ( X ′ X ) − 1 X ′ y
其抽样方差为:
Var ( y ^ new ∣ X , x new ) = σ 2 x new ′ ( X ′ X ) − 1 x new \operatorname{Var}(\hat{y}_{\text{new}} \mid \mathbf{X}, \mathbf{x}_{\text{new}}) = \sigma^2 \mathbf{x}_{\text{new}}' (\mathbf{X}' \mathbf{X})^{-1} \mathbf{x}_{\text{new}} Var ( y ^ new ∣ X , x new ) = σ 2 x new ′ ( X ′ X ) − 1 x new
该方差的形式揭示了预测精度的关键决定因素:它既依赖于总体噪声水平 σ 2 \sigma^2 σ 2 ,也依赖于 x new ′ ( X ′ X ) − 1 x new \mathbf{x}_{\text{new}}' (\mathbf{X}' \mathbf{X})^{-1} \mathbf{x}_{\text{new}} x new ′ ( X ′ X ) − 1 x new ,后者可解释为新观测的自变量向量到已有样本自变量空间中心的一种马氏距离(Mahalanobis Distance)。离样本中心越远的 x new \mathbf{x}_{\text{new}} x new ,其预测方差越大,预测区间越宽。这一性质与外推 (Extrapolation)风险的直觉完全一致:在已有数据支持范围之外进行预测时,不确定性必然增大。
基于此,因变量在 x new \mathbf{x}_{\text{new}} x new 处的 100 ( 1 − α ) % 100(1-\alpha)\% 100 ( 1 − α ) % 预测区间为:
y ^ new ± t α / 2 , n − k − 1 ⋅ σ ^ 1 + x new ′ ( X ′ X ) − 1 x new \hat{y}_{\text{new}} \pm t_{\alpha/2, n-k-1} \cdot \hat{\sigma} \sqrt{1 + \mathbf{x}_{\text{new}}' (\mathbf{X}' \mathbf{X})^{-1} \mathbf{x}_{\text{new}}} y ^ new ± t α /2 , n − k − 1 ⋅ σ ^ 1 + x new ′ ( X ′ X ) − 1 x new
假设检验中的角色
在经典的t检验 和F检验 中,自变量观测向量构成的自变量观测矩阵 X \mathbf{X} X 通过其叉积矩阵 X ′ X \mathbf{X}' \mathbf{X} X ′ X 直接影响估计量的方差-协方差矩阵:
Var ( β ^ ∣ X ) = σ 2 ( X ′ X ) − 1 \operatorname{Var}(\hat{\boldsymbol{\beta}} \mid \mathbf{X}) = \sigma^2 (\mathbf{X}' \mathbf{X})^{-1} Var ( β ^ ∣ X ) = σ 2 ( X ′ X ) − 1
因此,单个回归系数 β ^ j \hat{\beta}_j β ^ j 的标准误为:
SE ( β ^ j ) = σ ^ [ ( X ′ X ) − 1 ] j j \text{SE}(\hat{\beta}_j) = \hat{\sigma} \sqrt{[(\mathbf{X}' \mathbf{X})^{-1}]_{jj}} SE ( β ^ j ) = σ ^ [( X ′ X ) − 1 ] jj
这意味着自变量之间的相关性结构——体现在 ( X ′ X ) − 1 (\mathbf{X}' \mathbf{X})^{-1} ( X ′ X ) − 1 的对角元大小——直接决定了参数推断的统计效力。当自变量间高度相关时,方差膨胀因子(VIF )增大,标准误膨胀,t统计量缩小,假设检验的势(Power)随之降低。在极端情形下,严重的多重共线性甚至使个别系数的符号与大小在经济意义上失去解释力,尽管模型的整体拟合优度可能仍然很高。
自变量观测向量的变换
在实际建模中,原始自变量观测向量经常经历各种变换以适配不同的分析目标:
标准化 (Standardization):对第 j j j 个自变量,计算 x ~ i j = ( x i j − x ˉ j ) / s j \tilde{x}_{ij} = (x_{ij} - \bar{x}_j) / s_j x ~ ij = ( x ij − x ˉ j ) / s j ,其中 x ˉ j \bar{x}_j x ˉ j 和 s j s_j s j 分别为样本均值和标准差。标准化后的自变量观测向量消除了量纲差异,使得回归系数可直接比较——标准化系数(Beta系数)度量的是自变量一个标准差变化所引起的因变量标准差变化量。
多项式扩展 (Polynomial Expansion):对原始自变量构造非线性项,扩展后的自变量观测向量为 x i = ( 1 , x i , x i 2 , … , x i p ) ′ \mathbf{x}_i = (1, x_i, x_i^2, \dots, x_i^p)' x i = ( 1 , x i , x i 2 , … , x i p ) ′ ,使得线性回归框架能够拟合曲率关系。此时,各阶项的系数需谨慎解读:边际效应不再是单一系数,而是 ∂ y / ∂ x = β 1 + 2 β 2 x + ⋯ + p β p x p − 1 \partial y / \partial x = \beta_1 + 2\beta_2 x + \cdots + p\beta_p x^{p-1} ∂ y / ∂ x = β 1 + 2 β 2 x + ⋯ + p β p x p − 1 。
交互项 (Interaction Terms):当研究者假设一个自变量的边际效应依赖于另一个自变量的水平时,构造交互项 x i 1 ⋅ x i 2 x_{i1} \cdot x_{i2} x i 1 ⋅ x i 2 作为新自变量加入向量。含交互项的观测向量为 x i = ( 1 , x i 1 , x i 2 , x i 1 x i 2 ) ′ \mathbf{x}_i = (1, x_{i1}, x_{i2}, x_{i1}x_{i2})' x i = ( 1 , x i 1 , x i 2 , x i 1 x i 2 ) ′ 。交互项的系数 β 12 \beta_{12} β 12 衡量了交叉偏导数 ∂ 2 y / ( ∂ x 1 ∂ x 2 ) \partial^2 y / (\partial x_1 \partial x_2) ∂ 2 y / ( ∂ x 1 ∂ x 2 ) ,其统计显著性检验了效应异质性假说。
与相关概念的辨析
自变量观测向量 需与以下几个紧密关联但含义不同的概念明确区分:
因变量观测向量 y \mathbf{y} y :n × 1 n \times 1 n × 1 列向量,包含所有观测的因变量值,位于回归方程左端,是回归分析中被解释的目标。自变量列向量 x ( j ) = ( x 1 j , x 2 j , … , x n j ) ′ \mathbf{x}^{(j)} = (x_{1j}, x_{2j}, \dots, x_{nj})' x ( j ) = ( x 1 j , x 2 j , … , x nj ) ′ :设计矩阵 X \mathbf{X} X 的第 j j j 列,包含第 j j j 个自变量在所有 n n n 个观测上的取值。自变量观测向量 x i \mathbf{x}_i x i 是"行视角",注重个体层面的综合信息;自变量列向量 x ( j ) \mathbf{x}^{(j)} x ( j ) 是"列视角",注重变量层面的跨个体分布。二者在数学上满足 X [ i , : ] = x i ′ \mathbf{X}_{[i,:]} = \mathbf{x}_i' X [ i , : ] = x i ′ 和 X [ : , j ] = x ( j ) \mathbf{X}_{[:,j]} = \mathbf{x}^{(j)} X [ : , j ] = x ( j ) 。协方差矩阵 Σ ^ X = 1 n X ~ ′ X ~ \hat{\Sigma}_X = \frac{1}{n} \tilde{\mathbf{X}}' \tilde{\mathbf{X}} Σ ^ X = n 1 X ~ ′ X ~ (其中 X ~ \tilde{\mathbf{X}} X ~ 为中心化后的设计矩阵):描述自变量之间的样本二阶矩结构,其特征值分布决定了多重共线性 的严重程度。条件数 κ ( Σ ^ X ) \kappa(\hat{\Sigma}_X) κ ( Σ ^ X ) 是度量共线性程度的常用指标。
结语
自变量观测向量 x i \mathbf{x}_i x i 是线性代数与统计建模的交汇点。它以简洁的向量形式封装了一个观测样本中含截距项的所有预测信息,贯穿于参数估计(正规方程)、拟合诊断(帽子矩阵与杠杆值)、统计推断(标准误与假设检验)和预测评估(预测区间)的每一个环节。从 x i \mathbf{x}_i x i 出发,整个 OLS 理论体系——从高斯-马尔可夫定理到沃尔德检验,从方差分析到模型诊断——均可获得统一的矩阵代数表达。深刻理解这一向量的定义、变换及其在叉积矩阵 X ′ X \mathbf{X}' \mathbf{X} X ′ X 中的角色,是掌握线性回归模型从理论推导到实证应用的必要起点。