普通最小二乘法 (Ordinary Least Squares, OLS)
普通最小二乘法 (Ordinary Least Squares, OLS),是计量经济学和统计学中最基本、最常用的一种参数估计方法,主要用于线性回归模型。其核心目标是找到一组参数,使得模型预测值与真实观测值之差(即残差)的平方和达到最小。通过这种方法得到的回归线被认为是数据的“最佳拟合线”。
OLS不仅是一种计算技术,它也是一套理论框架的基础。理解OLS是学习更高级回归技术(如广义最小二乘法、工具变量法等)的基石。
核心思想:最小化残差平方和
假设我们有一个简单的线性回归模型,用以描述变量 X(自变量或解释变量)和变量 Y(因变量或被解释变量)之间的关系:
Yi=β0+β1Xi+ui
其中:
- Yi 是第 i 个观测的因变量值。
- Xi 是第 i 个观测的自变量值。
- β0 是模型的截距 (intercept),代表当 X=0 时 Y 的期望值。
- β1 是模型的斜率 (slope),代表 X 每增加一个单位,Y 的期望变化量。
- ui 是误差项 (error term) 或扰动项,代表所有其他未被模型包含但影响 Y 的因素,以及固有的随机性。
我们的目标是利用一组样本数据 (Xi,Yi),来估计未知的真实参数 β0 和 β1。我们将估计得到的值记为 β^0 和 β^1。
对于任意一组估计值 β^0 和 β^1,我们可以得到一个拟合(或预测)的 Yi 值:
Y^i=β^0+β^1Xi
真实值 Yi 和拟合值 Y^i 之间的差异被称为残差 (residual),记为 ei:
ei=Yi−Y^i=Yi−(β^0+β^1Xi)
OLS的直观思想是,我们应该选择这样的一组 β^0 和 β^1,使得这条回归线“尽可能地”接近所有的样本点。OLS将“接近”定义为所有样本点的残差平方和 (Sum of Squared Residuals, SSR) 最小。
选择残差的平方和,而不是残差本身的和,有以下几个原因:
- 残差有正有负,直接相加会相互抵消,无法衡量整体的拟合优度。
- 平方项使得较大的残差被赋予更高的“惩罚”,从而使模型对异常值更敏感。
- 从数学上讲,平方和函数是凸函数,易于求导和求解最小值。
因此,OLS的优化问题可以写成:
β^0,β^1minSSR(β^0,β^1)=i=1∑nei2=i=1∑n(Yi−β^0−β^1Xi)2
其中 n 是样本容量。
数学推导
为了找到使 SSR 最小的 β^0 和 β^1,我们使用微积分中的方法,即对 SSR 分别求关于 β^0 和 β^1 的偏导数,并令其等于零。这被称为一阶条件 (First-Order Conditions, FOCs)。
- 对 β^0 求偏导:
∂β^0∂SSR=i=1∑n2(Yi−β^0−β^1Xi)(−1)=−2i=1∑n(Yi−β^0−β^1Xi)=0
简化后得到:
i=1∑nYi=nβ^0+β^1i=1∑nXi
两边同除以 n,得到:
Yˉ=β^0+β^1Xˉ⟹β^0=Yˉ−β^1Xˉ
其中 Yˉ 和 Xˉ 分别是 Y 和 X 的样本均值。这个结果表明,OLS回归线必然通过样本均值点 (Xˉ,Yˉ)。
- 对 β^1 求偏导:
∂β^1∂SSR=i=1∑n2(Yi−β^0−β^1Xi)(−Xi)=−2i=1∑nXi(Yi−β^0−β^1Xi)=0
简化后得到:
i=1∑nXiYi=β^0i=1∑nXi+β^1i=1∑nXi2
将 β^0=Yˉ−β^1Xˉ 代入上式并整理,经过一系列代数运算,我们可以得到 β^1 的解:
β^1=∑i=1n(Xi−Xˉ)2∑i=1n(Xi−Xˉ)(Yi−Yˉ)=Var(X)Cov(X,Y)
这个公式直观地表示,斜率估计值是 X 和 Y 的样本协方差与 X 的样本方差之比。
矩阵形式 (Matrix Form)
对于包含 k 个自变量的多元线性回归模型:
Yi=β0+β1X1i+β2X2i+⋯+βkXki+ui
使用矩阵表示会更为简洁。模型可以写为:
y=Xβ+u
其中:
- y 是一个 n×1 的因变量观测值向量。
- X 是一个 n×(k+1) 的自变量数据矩阵(第一列通常是1,对应截距项)。
- β 是一个 (k+1)×1 的未知参数向量。
- u 是一个 n×1 的误差项向量。
OLS的目标是最小化残差平方和 SSR=e′e=(y−Xβ^)′(y−Xβ^)。 通过矩阵求导并令其为零,可以得到OLS估计量的矩阵表达式:
β^=(X′X)−1X′y
这个公式是计量经济学中最重要的公式之一,它为计算任意多元线性回归模型的系数提供了通用的解决方案。
OLS的经典假设 (高斯-马尔可夫假设)
OLS估计量具有一些优良的统计性质,但这些性质的成立依赖于一组被称为高斯-马尔可夫 (Gauss-Markov) 假设的经典假定。当这些假设成立时,OLS估计量是最佳线性无偏估计量 (Best Linear Unbiased Estimator, BLUE)。
- 线性于参数 (Linearity in Parameters):模型 Y=β0+β1X+u 必须是关于参数 β0 和 β1 的线性函数。变量本身可以是非线性的(例如,Y=β0+β1log(X)+u 仍然是线性模型)。
- 随机抽样 (Random Sampling):样本数据 {(Xi,Yi):i=1,…,n} 是从总体中随机抽取的。
- 不存在完全多重共线性 (No Perfect Multicollinearity):在多元回归中,任何一个自变量都不能是其他自变量的完全线性组合。这意味着矩阵 X′X 是可逆的。
- 零条件均值 (Zero Conditional Mean):误差项的期望值在给定任何自变量值的情况下都为零,即 E(ui∣X1i,…,Xki)=0。这是最关键的假设,它保证了OLS估计量的无偏性。如果这个假设不成立(例如,由于遗漏变量偏误或联立性偏误),OLS估计量将是有偏的。
- 同方差 (Homoskedasticity):误差项的方差在给定任何自变量值的情况下都是一个常数,即 Var(ui∣X1i,…,Xki)=σ2。如果方差随 X 的变化而变化,则称存在异方差 (Heteroskedasticity)。
- 无自相关 (No Serial Correlation / Autocorrelation):不同观测值的误差项之间不相关,即对于 i=j,Cov(ui,uj∣X)=0。这个假设在处理时间序列数据时尤为重要。
OLS估计量的性质
在满足高斯-马尔可夫假设(前五个或前六个,取决于数据类型)的前提下,OLS估计量 β^ 具有以下良好性质:
- 无偏性 (Unbiasedness):E(β^)=β。这意味着,如果我们反复从总体中抽样并进行回归,得到的估计值的平均值会等于真实的总体参数。
- 有效性 (Efficiency):在所有的线性无偏估计量中,OLS估计量具有最小的方差。这就是高斯-马尔可夫定理的核心内容,即OLS是BLUE (Best Linear Unbiased Estimator)。
- 一致性 (Consistency):当样本容量 n→∞ 时,OLS估计量 β^ 依概率收敛于真实的参数 β。这意味着随着样本量的增加,我们的估计会越来越接近真实值。
如果高斯-马尔可夫假设中的某一条被违反(例如出现异方差或自相关),OLS估计量可能不再是“最佳”的(即不再具有最小方差),但只要零条件均值假设(假设4)仍然成立,它通常仍然是无偏和一致的。在这种情况下,需要使用修正的标准误(如异方差稳健标准误)或采用更高级的估计方法(如广义最小二乘法)。