知经百科 / Z

最小二乘估计(OLS)

最小二乘估计 (Ordinary Least Squares, OLS)

最小二乘估计(Ordinary Least Squares,简称 OLS),常称为最小二乘法,是统计学计量经济学中最基本且应用最广泛的参数估计方法。它由 Carl Friedrich Gauss 于 18 世纪末在研究天体轨道时首次提出,Adrien-Marie Legendre 于 1805 年独立发表。OLS 用于拟合线性回归模型,核心目标是寻找一组参数,使得模型预测值与样本观测值之间的残差平方和(Sum of Squared Residuals, SSR)达到最小。换言之,OLS 在所有可能的直线(或超平面)中选择一条,使所有数据点到该线的竖直距离的平方之和最小。因其数学形式简洁、计算方便、且在经典假设下具备优良统计性质(无偏性、有效性、一致性),OLS 成为回归分析的基石,也是理解几乎所有高级计量方法的出发点。

模型设定与基本概念

考虑最简单的情形——简单线性回归模型。设因变量 YY 与单一自变量 XX 之间满足线性关系:

Yi=β0+β1Xi+ui,i=1,2,,nY_i = \beta_0 + \beta_1 X_i + u_i, \quad i = 1, 2, \ldots, n

其中 β0\beta_0截距项(intercept),表示当 X=0X = 0YY 的期望值;β1\beta_1 为斜率系数(slope),衡量 XX 每变动一个单位时 YY 的期望变化量;uiu_i误差项(error term)或称扰动项,代表除 XX 之外所有影响 YY 但未被纳入模型的因素,包括测量误差、遗漏变量和随机冲击等。

回归分析的任务是:利用样本数据 {(Xi,Yi)}i=1n\{(X_i, Y_i)\}_{i=1}^n,对未知总体参数 β0\beta_0β1\beta_1 进行估计。OLS 方法得到的估计值记作 β^0\hat{\beta}_0β^1\hat{\beta}_1,并由此构建样本回归函数(SRF):

Y^i=β^0+β^1Xi\hat{Y}_i = \hat{\beta}_0 + \hat{\beta}_1 X_i

最小化残差平方和

定义残差 ei=YiY^ie_i = Y_i - \hat{Y}_i 为真实值与拟合值之差,是误差项 uiu_i 的样本对应物。OLS 的核心原则是选择 β^0\hat{\beta}_0β^1\hat{\beta}_1,使残差平方和最小化:

minβ^0,β^1SSR=i=1nei2=i=1n(Yiβ^0β^1Xi)2\min_{\hat{\beta}_0, \hat{\beta}_1} SSR = \sum_{i=1}^{n} e_i^2 = \sum_{i=1}^{n} (Y_i - \hat{\beta}_0 - \hat{\beta}_1 X_i)^2

采用平方形式有三重考量:其一,平方使正负残差均变为非负,避免相互抵消;其二,平方赋予大残差更大权重,使 OLS 更关注偏离较远的观测点——这既是优点(对离群信息敏感),也是缺点(对离群值过于敏感);其三,SSR 是关于 β^0\hat{\beta}_0β^1\hat{\beta}_1 的二次函数,其曲面光滑、连续且处处可微,便于运用微积分求解闭式解。

OLS 估计量的推导

对 SSR 分别求关于 β^0\hat{\beta}_0β^1\hat{\beta}_1 的偏导数并令其为零,得正规方程(Normal Equations):

Yi=nβ^0+β^1XiXiYi=β^0Xi+β^1Xi2\begin{aligned} \sum Y_i &= n\hat{\beta}_0 + \hat{\beta}_1 \sum X_i \\ \sum X_i Y_i &= \hat{\beta}_0 \sum X_i + \hat{\beta}_1 \sum X_i^2 \end{aligned}

求解该方程组,得到 OLS 估计量的闭式解:

β^1=i=1n(XiXˉ)(YiYˉ)i=1n(XiXˉ)2,β^0=Yˉβ^1Xˉ\hat{\beta}_1 = \frac{\sum_{i=1}^{n} (X_i - \bar{X})(Y_i - \bar{Y})}{\sum_{i=1}^{n} (X_i - \bar{X})^2}, \quad \hat{\beta}_0 = \bar{Y} - \hat{\beta}_1 \bar{X}

其中 Xˉ\bar{X}Yˉ\bar{Y} 为样本均值。斜率 β^1\hat{\beta}_1XXYY 的样本协方差成正比,与 XX 的样本方差成反比——直观上,XX 变化越大,斜率估计越精确。截距公式保证回归线必然穿过样本均值点 (Xˉ,Yˉ)(\bar{X}, \bar{Y})

推广至多元线性回归模型 Y=Xβ+uY = X\beta + u,OLS 的矩阵形式解为:

β^=(XX)1XY\hat{\beta} = (X'X)^{-1}X'Y

其中 YYn×1n \times 1 因变量向量,XXn×(k+1)n \times (k+1) 设计矩阵,β^\hat{\beta}(k+1)×1(k+1) \times 1 参数向量。该表达式要求 XXX'X 可逆,即自变量间不存在完全共线性。

高斯-马尔可夫定理

OLS 的理论支柱是高斯-马尔可夫定理(Gauss-Markov Theorem)。在以下经典线性模型假设(高斯-马尔可夫假设)下,OLS 估计量是最佳线性无偏估计量(Best Linear Unbiased Estimator, BLUE):

  • 参数线性:模型对参数 βj\beta_j 是线性的。
  • 随机抽样:样本从总体中独立随机抽取。
  • 无完全共线性:自变量间不存在精确线性关系。
  • 零条件均值E(uX)=0E(u \mid X) = 0,或称外生性假设——这是最关键的假设,保证 XXuu 不相关。若违背则产生内生性问题,OLS 有偏且不一致。
  • 同方差性Var(uX)=σ2Var(u \mid X) = \sigma^2 为常数。若误差方差随 XX 变化,则存在异方差性
  • 无自相关Cov(ui,ujX)=0Cov(u_i, u_j \mid X) = 0 对所有 iji \neq j 成立,在时间序列数据中尤为重要。

BLUE 的含义:线性——β^j\hat{\beta}_jYiY_i 的线性组合;无偏——E(β^j)=βjE(\hat{\beta}_j) = \beta_j,重复抽样下估计值以真实值为中心;最佳——在所有线性无偏估计量中方差最小,即估计最精确。

当假设被违背时,需诉诸替代方法:异方差下用加权最小二乘法(WLS)或稳健标准误;自相关下用广义最小二乘法(GLS);内生性下用工具变量法(IV),以与误差项不相关但与内生变量高度相关的变量作为工具。

拟合优度:R2R^2

获得 OLS 估计后,需评估模型对数据的拟合程度。最常用的指标是判定系数 公式暂不可显示R2R^2):

R2=SSESST=1SSRSSTR^2 = \frac{SSE}{SST} = 1 - \frac{SSR}{SST}

其中 SST=(YiYˉ)2SST = \sum (Y_i - \bar{Y})^2 为总平方和,SSR=(YiY^i)2SSR = \sum (Y_i - \hat{Y}_i)^2 为残差平方和,SSE=(Y^iYˉ)2SSE = \sum (\hat{Y}_i - \bar{Y})^2 为解释平方和。R2[0,1]R^2 \in [0, 1],越接近 1 说明模型解释能力越强。但 R2R^2 随着自变量增加而单调不减,因此在比较多变量模型时,应使用调整的R-squaredRˉ2\bar{R}^2),它对无谓增多的自变量施加惩罚。值得注意的是,高 R2R^2 并不意味着模型设定正确或因果关系成立——R2R^2 仅度量相关性强弱,而非因果效应的存在与否。

局限与拓展

尽管 OLS 是回归分析的基石,其局限性亦需正视。OLS 对离群值敏感,单个极端观测即可大幅改变估计结果;它依赖严格的假设条件——外生性、同方差、无自相关——而这些假设在观测性研究中往往难以同时满足;OLS 也无法直接处理高维数据中自变量数超过样本数的情形。此外,OLS 仅捕捉条件均值,无法刻画分布的尾部特征和异质效应。

针对这些问题,现代计量经济学发展了一系列拓展方法:岭回归Lasso 通过引入正则化项处理高维和共线性问题,在偏差与方差之间取得平衡;分位数回归对离群值更为稳健,且能刻画条件分布的不同分位点,揭示变量间更为丰富的关系结构;工具变量法双重差分法(DID)则应对内生性挑战,在因果推断中扮演关键角色。尽管如此,OLS 凭借其简便、透明和坚实的理论基础,始终是实证研究者理解数据、检验假说的首选工具,也是学习更高级计量方法的必经之路。

返回百科索引