总体回归线
总体回归线(Population Regression Line)是计量经济学与统计学中的核心概念,描述了在给定解释变量 的条件下,被解释变量 的条件期望值随 变化的函数关系,通常记为 。在经典线性回归模型中,这一关系被设定为线性形式:,其中 和 是总体参数,即总体回归系数。
总体回归线的本质是条件期望函数(CEF)。它刻画了在 取某一特定值时, 在总体中的平均取值。例如,研究收入与教育年限的关系时,总体回归线回答了"在所有受教育年限为 12 年的人群中,平均收入是多少"这一问题。这一函数排除了个体间的随机扰动,揭示的是系统性规律。
与总体回归线相对应的概念是样本回归线(Sample Regression Line)。总体回归线是理论上的、不可直接观测的真实关系,而样本回归线是基于样本数据对总体回归线的估计。样本回归函数(SRF)可记为 ,其中 和 是总体参数 和 的估计量。由于抽样误差的存在,样本回归线会围绕总体回归线波动。根据高斯-马尔可夫定理,在经典假定下,普通最小二乘(OLS)估计量是 Best Linear Unbiased Estimator(BLUE),即最优线性无偏估计量。
总体回归线的核心假定包括:(1)线性性: 是 的线性函数;(2)严格外生性:,即误差项的条件均值为零;(3)同方差性:,即误差项的方差恒定;(4)无自相关:,。这些假定保证了 OLS 估计量的无偏性、一致性和有效性。
在实践中,总体回归线的形式往往是未知的。研究者需要通过经济理论、散点图分析或非参数方法对函数形式进行设定。常用的模型设定检验包括 Ramsey RESET 检验、似然比检验和 AIC/BIC 信息准则等。若真实关系是非线性的,但研究者误设为线性形式,则会导致模型设定误差(Specification Error),使估计结果产生偏误。
总体回归线的斜率参数 具有重要的经济含义:它表示 每变动一个单位, 的条件期望值变动的数量。在因果推断中, 被解释为 对 的边际效应(Marginal Effect),但需要注意,这一因果解释依赖于条件独立性假设 及其他识别条件。在多元回归中, 表示在控制其他变量不变的情况下, 变动一个单位对 的偏效应(Partial Effect)。
总体回归线还可推广至非线性设定,如对数线性模型、半对数模型和多项式回归模型等。在这些情形下,边际效应不再恒定,而取决于 的具体取值。此外,当 为二元变量时,总体回归线对应的是线性概率模型(LPM),此时条件期望 ,表示给定 时 的概率。
总体回归线与回归分解密切相关。根据方差分解公式,,其中 是由回归模型解释的变异,即回归平方和(ESS)对应的总体概念,而 是未被解释的随机变异,即残差平方和(RSS)对应的总体概念。拟合优度 在总体中的对应量即为 ,衡量了总体回归线对 变异的解释能力。
从历史发展的角度来看,总体回归线的思想根源可追溯至19世纪弗朗西斯·高尔顿(Francis Galton)对"均值回归"现象的发现。高尔顿在观察父子身高数据时注意到,虽然高个子父亲往往有较高的儿子,但儿子的身高趋向于总体均值,这一现象被他称为"回归到均值"(Regression toward the Mean)。卡尔·皮尔逊(Karl Pearson)随后将其形式化为相关与回归分析的理论框架。20世纪中期,随着计量经济学的兴起,Trygve Haavelmo、Jan Tinbergen 等人将回归方法系统引入经济学,使总体回归线成为结构方程建模和因果推断的核心工具。
在当代计量经济学中,总体回归线的概念已扩展至更广泛的框架。在面板数据分析中,总体回归线可允许个体异质性,通过固定效应或随机效应模型加以刻画。在工具变量(IV)估计中,总体回归线对应的是由工具变量识别的局部平均处理效应(LATE)。此外,机器学习方法如随机森林和神经网络虽不显式设定线性形式,但本质上也是在估计条件期望函数 ,即广义的总体回归线。
总体回归线是计量经济学理论体系的基石。它既为统计推断提供了理论框架,也为经济政策的因果效应分析奠定了方法论基础。理解总体回归线与样本回归线的区别,以及总体回归线背后蕴含的假定条件,是正确应用回归分析方法的前提。