知经百科 / Y

样本回归线

样本回归线(Sample Regression Line,简称SRL)是指在给定一组样本观测数据 {(xi,yi):i=1,2,,n} \{(x_i, y_i): i = 1, 2, \dots, n\} 后,通过某种估计方法——最常用的是普通最小二乘法(OLS)——拟合得到的一条直线,用以刻画因变量 y y 与自变量 x x 之间的经验线性关系。样本回归线的数学表达式为:

y^=β^0+β^1x\hat{y} = \hat{\beta}_0 + \hat{\beta}_1 x

其中 y^ \hat{y} 表示因变量的拟合值(或称预测值),β^0 \hat{\beta}_0 β^1 \hat{\beta}_1 分别是总体截距 β0 \beta_0 和斜率 β1 \beta_1 的样本估计量。样本回归线是总体回归线(Population Regression Line,PRL)在有限样本下的经验对应物,是计量经济学实证分析的起点和核心输出之一。从几何上看,样本回归线是散布图中与样本数据点"距离最近"的一条直线,其中"距离"由特定的损失函数——即残差平方和——来定义。样本回归线 y y 轴上的截距 β^0 \hat{\beta}_0 表示当 x=0 x = 0 y y 的预测值,斜率 β^1 \hat{\beta}_1 则表示 x x 每增加一个单位时 y y 预测值的平均变化量。

样本回归线与总体回归线

理解样本回归线的关键在于区分其与总体回归线的本质差异。总体回归线刻画的是给定 x x y y 的条件期望:E(yx)=β0+β1x E(y \mid x) = \beta_0 + \beta_1 x ,它是理论上的、不可直接观测的真实关系。样本回归线则是研究者基于手头的数据对这条不可见的总体系进行的估计。二者之间存在抽样误差,即 β^1 \hat{\beta}_1 一般不会恰好等于 β1 \beta_1 β^0 \hat{\beta}_0 也不会恰好等于 β0 \beta_0 ,因为样本只是总体的一个子集,包含了随机波动。对于任意观测点 i i ,样本回归线满足以下分解关系:

yi=y^i+u^i=β^0+β^1xi+u^iy_i = \hat{y}_i + \hat{u}_i = \hat{\beta}_0 + \hat{\beta}_1 x_i + \hat{u}_i

其中 u^i \hat{u}_i 为第 i i 个观测值的残差,是 yi y_i 的真实值偏离样本回归线的部分。残差 u^i \hat{u}_i 可视为误差项 ui u_i 的样本实现,但二者有重要区别:ui u_i 是总体模型中的不可观测随机项,而 u^i \hat{u}_i 是可计算的样本量。样本回归线穿过样本均值点 (xˉ,yˉ) (\bar{x}, \bar{y}) ,且残差之和 u^i \sum \hat{u}_i 恰好为零,这些性质由 OLS 的正规方程组直接保证。

OLS 估计与样本回归线

普通最小二乘法通过最小化残差平方和来确定样本回归线:

minβ^0,β^1i=1n(yiβ^0β^1xi)2\min_{\hat{\beta}_0, \hat{\beta}_1} \sum_{i=1}^{n} (y_i - \hat{\beta}_0 - \hat{\beta}_1 x_i)^2

求解一阶条件得到斜率估计量的闭式表达式:

β^1=i=1n(xixˉ)(yiyˉ)i=1n(xixˉ)2=Cov^(x,y)Var^(x),β^0=yˉβ^1xˉ\hat{\beta}_1 = \frac{\sum_{i=1}^{n}(x_i - \bar{x})(y_i - \bar{y})}{\sum_{i=1}^{n}(x_i - \bar{x})^2} = \frac{\widehat{Cov}(x, y)}{\widehat{Var}(x)}, \quad \hat{\beta}_0 = \bar{y} - \hat{\beta}_1 \bar{x}

β^1 \hat{\beta}_1 的分子是 x x y y 的样本协方差,分母是 x x 的样本方差,因此斜率估计量本质上衡量了 x x y y 之间共变关系的方向与强度。若 x x y y 正相关,则 β^1>0 \hat{\beta}_1 > 0 ,样本回归线向右上方倾斜;反之向下倾斜。当样本量 n n 充分大且经典假设成立时,β^1 \hat{\beta}_1 依概率收敛到 β1 \beta_1 ,样本回归线趋于总体回归线——这一性质称为一致性。但在有限样本中,样本回归线始终只是总体回归线的一个近似,其近似精度取决于样本容量、x x 的变异程度以及误差方差的大小。

样本回归线的代数性质

OLS 估计的样本回归线具有若干重要的代数性质。第一,残差之和为零:i=1nu^i=0 \sum_{i=1}^{n} \hat{u}_i = 0 ,这意味着样本回归线恰好平衡了正、负残差。第二,残差与自变量正交:i=1nxiu^i=0 \sum_{i=1}^{n} x_i \hat{u}_i = 0 ,这一性质反映了自变量 x x 中不包含可用于预测残差的线性信息。第三,拟合值的均值等于 y y 的样本均值:1ni=1ny^i=yˉ \frac{1}{n}\sum_{i=1}^{n} \hat{y}_i = \bar{y} ,即样本回归线的"形心"落在 (xˉ,yˉ) (\bar{x}, \bar{y}) 处。第四,残差与拟合值正交:i=1ny^iu^i=0 \sum_{i=1}^{n} \hat{y}_i \hat{u}_i = 0 ,说明拟合值与残差之间不存在线性相关。这些代数性质不仅是 OLS 数学推导的直接结果,也是回归诊断和模型扩展(如加权最小二乘和广义最小二乘)的基础。任何违反这些性质的迹象都暗示着模型可能设定有误或存在数据问题。

拟合优度与样本回归线

样本回归线对数据的拟合程度通过判定系数 R2 R^2 来度量。R2 R^2 定义为回归平方和与总平方和之比:R2=SSE/SST=1SSR/SST R^2 = SSE / SST = 1 - SSR/SST ,其中 SST=(yiyˉ)2 SST = \sum(y_i - \bar{y})^2 SSE=(y^iyˉ)2 SSE = \sum(\hat{y}_i - \bar{y})^2 SSR=(yiy^i)2 SSR = \sum(y_i - \hat{y}_i)^2 R2 R^2 的取值范围为 [0,1] [0, 1] :当 R2=1 R^2 = 1 时,所有样本点恰好落在样本回归线上,残差为零;当 R2=0 R^2 = 0 时,样本回归线为水平线(即 β^1=0 \hat{\beta}_1 = 0 ),自变量 x x 不能解释 y y 的任何变异。在简单回归中,R2 R^2 的平方根等于 x x y y 的样本相关系数 rxy r_{xy} ,这揭示了回归分析与相关性分析之间的内在联系。需要特别注意的是,高 R2 R^2 并不必然意味着样本回归线准确刻画了真实的因果关系——在时间序列数据中,两个无经济关系的变量可能因共同的时间趋势而呈现高 R2 R^2 ,即出现伪回归问题。因此,R2 R^2 应被视为描述性统计量而非因果判据。

应用与解释

在实证研究中,样本回归线既是描述性工具也是推断性工具。作为描述性工具,它浓缩了 x x y y 之间的经验关系模式,使研究者能够直观地观察变量间的平均变化方向与幅度——例如在教育经济学的经典研究中,以受教育年限为 x x 、工资对数为 y y 的样本回归线斜率为 0.08 意味着每多受一年教育,工资平均增长约 8\%。作为推断性工具,样本回归线提供了对总体回归线的点估计,研究者据此可以对总体参数进行假设检验和区间估计。假设检验通常关注斜率是否显著不为零,而区间估计则给出了参数取值的可能范围,二者共同构成了统计推断的核心框架。

在使用样本回归线进行推断时,必须警惕过度外推的风险——自变量的取值范围往往受限于样本数据,大幅超出该范围的预测依赖线性假设的强力维持,缺乏数据支撑。此外,样本回归线对异常值和杠杆点极为敏感,单个极端观测点可能显著地改变回归线的斜率与截距,因此研究者应在报告回归结果的同时呈现散点图和残差诊断信息,以便读者评估样本回归线的稳健性。稳健性检验如使用不同的样本子集或估计方法,可进一步确认样本回归线所揭示的关系是否可靠,避免因偶然性因素导致的误导性结论。

关键术语

关键术语

中文英文
样本回归线Sample Regression Line (SRL)
总体回归线Population Regression Line (PRL)
拟合值Fitted Value
残差Residual
普通最小二乘Ordinary Least Squares (OLS)
截距估计量Estimated Intercept
斜率估计量Estimated Slope
判定系数Coefficient of Determination
样本均值点Sample Mean Point
残差平方和Residual Sum of Squares (SSR)
回归平方和Explained Sum of Squares (SSE)
总平方和Total Sum of Squares (SST)
一致性Consistency
无偏性Unbiasedness
正规方程组Normal Equations
过拟合Overfitting
伪回归Spurious Regression
杠杆点Leverage Point

返回百科索引