最小二乘估计无偏性的条件
最小二乘估计无偏性的条件 (Conditions for Unbiasedness of OLS Estimator)
最小二乘估计无偏性的条件 是指在线性回归模型 (Linear Regression Model) 中,为了保证通过普通最小二乘法 (Ordinary Least Squares, OLS) 得到的参数估计量 (Estimator) 具备无偏性 (Unbiasedness) 所必须满足的一系列假定。无偏性是评价估计量优良性的一个重要标准,它意味着在多次重复抽样中,该估计量的期望值(或平均值)等于被估计的真实总体参数。
具体而言,如果 是真实的总体参数,而 是其OLS估计量,那么无偏性可以用数学语言表达为:
为了确保这一理想属性成立,OLS方法对数据生成过程 (Data Generating Process) 提出了一系列假定,通常被称为高斯-马尔可夫假定 (Gauss-Markov Assumptions) 的一部分。值得注意的是,并非所有高斯-马尔可夫假定都是无偏性所必需的。以下将详细阐述确保OLS估计量无偏性的核心条件。
理论模型设定
我们首先设定一个多元线性回归的总体模型 (Population Model):
其中:
- 是因变量 (Dependent Variable)。
- 是自变量 (Independent Variables)。
- 是我们希望估计的未知总体参数。 是截距项 (Intercept),其余为斜率参数 (Slope Parameters)。
- 是误差项 (Error Term) 或扰动项 (Disturbance),代表了所有影响 但未被模型中的自变量所解释的因素。
无偏性的四大核心条件
对于一个包含 个观测值的样本,OLS估计量要想是无偏的,必须满足以下四个关键条件。
条件一:参数线性 (Linearity in Parameters)
模型必须是关于参数 的线性函数。
- 解释:这意味着参数本身不能以指数、对数、分数等非线性形式出现。此假定并不要求自变量或因变量本身是线性的。
- 示例:
- 是参数线性的,因为 可以被看作一个新的自变量。
- 也是参数线性的。
- 则 不是 参数线性的,OLS方法不直接适用。
条件二:随机抽样 (Random Sampling)
我们拥有的数据集 是从总体模型中随机抽取的一个样本。
- 解释:此假定确保了样本中的每个观测值 都是从同一总体中独立抽取的,并且遵循相同的概率分布。这通常被称为独立同分布 (Independent and Identically Distributed, i.i.d.) 假定。在横截面数据分析中,这一假定通常是合理的。
条件三:无完全共线性 (No Perfect Collinearity)
在样本中,任何一个自变量都不能是其他自变量的精确线性组合。
- 解释:完全共线性 (Perfect Collinearity) 意味着自变量之间存在完美的线性关系。例如,。在这种情况下,模型无法区分 和 对 的独立影响。从数学上看,这会导致矩阵 成为一个奇异矩阵 (Singular Matrix),无法求逆,因此OLS估计量 无法计算。
- 常见来源:
- 重复变量:将同一个变量包含两次。
- 变量的单位转换:例如,同时将以米为单位的身高和以厘米为单位的身高放入模型。
- 虚拟变量陷阱 (Dummy Variable Trap):为一个有 个类别的定性变量创建了 个虚拟变量 (Dummy Variables) 并全部放入模型中,而没有省略一个作为基准组。
条件四:误差项的零条件均值 (Zero Conditional Mean of the Error Term)
给定样本中任何自变量的观测值,误差项的期望值为零。
- 解释:这是确保无偏性的 最关键、也最核心 的假定。它要求自变量 必须是外生的 (Exogenous)。这意味着自变量 和影响 的所有未观测因素 之间不存在系统性关联。换言之,我们所包含的自变量不能提供任何关于误差项均值的信息。
- 违反此假定的后果:如果该假定不成立(即 ),OLS估计量将是有偏的 (Biased) 甚至是不一致的 (Inconsistent)。这意味着即使样本容量趋于无穷,估计量也不会收敛到真实的参数值。
- 常见违例情况:
- 遗漏变量偏误 (Omitted Variable Bias):模型遗漏了一个与因变量 相关,并且与模型中至少一个自变量 相关的重要变量。这个被遗漏的变量的影响就会进入误差项 中,导致 和 相关。
- 测量误差 (Measurement Error):如果自变量的测量存在误差,那么测量值与真实的误差项之间可能存在相关性。
- 联立性 (Simultaneity) 或 反向因果关系 (Reverse Causality): 不仅受 的影响,同时 的变化也会反过来影响 。这在宏观经济学模型中很常见,例如消费与收入的关系。
无偏性的数学证明
基于上述四个假定,我们可以简洁地证明OLS估计量的无偏性。 首先,将OLS估计量 写为:
将真实的总体模型 代入上式:
利用矩阵乘法的分配律展开:
根据“无完全共线性”假定 (条件三),矩阵 是可逆的,因此 (单位矩阵)。上式简化为:
现在,我们对 求期望。为了体现条件四的作用,我们先求在给定自变量矩阵 下的条件期望:
因为 是一个固定的常数向量,而 在条件中是给定的,所以 也是给定的。因此:
此时,我们应用“零条件均值”假定 (条件四),即 。于是:
最后,根据期望的迭代定律 (Law of Total Expectation), 的无条件期望是其条件期望的期望:
至此,OLS估计量的无偏性得到证明。
无偏性所“不”需要的假定
学习者务必区分清楚,以下两个常与OLS一起讨论的假定对于证明 无偏性 而言,并非是必需的。
- 误差项的同方差性 (Homoskedasticity):即 。这个假定要求误差项的方差对于所有自变量的取值都保持不变。如果此假定不成立,则存在异方差性 (Heteroskedasticity)。异方差性 不影响 OLS估计量的无偏性,但会使其不再是最佳线性无偏估计量 (BLUE),并且会导致常规的标准误 (Standard Error) 计算失效,影响假设检验的有效性。
- 误差项的正态分布 (Normality of Error Terms):即 。此假定对于无偏性也 不是必需的。正态性假定主要用于在小样本情况下进行精确的统计推断(如构建 统计量和 统计量)。在大样本中,根据中心极限定理 (Central Limit Theorem),即使误差项非正态,OLS估计量也会渐近服从正态分布,使得统计推断依然有效。
总结
总而言之,OLS估计量的无偏性是一个非常理想的统计特性,它保证了我们的估计方法在平均意义上是准确的。它的成立依赖于四个关键条件:参数线性、随机抽样、无完全共线性以及至关重要的零条件均值假定。在任何计量经济分析 (Econometric Analysis) 的实践中,研究者都需要仔细审视和检验这些假定,特别是零条件均值假定,因为对它的违反是导致模型设定偏误 (Model Misspecification) 和错误结论的最常见根源。