调整的R² (Adjusted R-squared)
调整的R² (Adjusted R-squared)
调整的R² (Adjusted R-squared),记为 或 ,是回归分析 (Regression Analysis) 中用于评估模型拟合优度 (Goodness of Fit) 的一个重要统计量。它是对标准R-squared()的修正,旨在解决标准 在模型中增加自变量 (Independent Variables) 时存在的系统性偏差问题。通过对模型中自变量的数量进行“惩罚”,调整的 为比较具有不同数量自变量的回归模型提供了一个更公允的评价基准。
标准 R² 的局限性
要理解调整的 的价值,首先必须了解标准 的内在缺陷。标准 ,也称为决定系数 (Coefficient of Determination),衡量的是因变量 (Dependent Variable) 的总变异中,能够被模型中自变量解释的百分比。其计算公式为:
其中:
标准 的一个核心问题是:在回归模型中,每增加一个新的自变量,无论该变量是否真的与因变量相关, 的值都只会增加或保持不变,绝不会减少。
这是因为,在数学上,向模型中添加任何变量都会使模型至少能与样本数据拟合得一样好(通常会更好),从而减少了残差平方和 。这会导致一种误导,即研究者可能仅仅通过堆砌大量不相关的变量来“人为地”提高模型的 值。这种做法会导致过拟合 (Overfitting),即模型对训练数据的拟合效果极好,但对新的、未见过的数据的预测能力(泛化能力)却很差。
调整的R²的原理与计算
调整的 通过引入对模型复杂度的惩罚项来修正这一问题。其核心思想是,只有当新加入的自变量对模型解释力的提升足够大,能够抵消其增加模型复杂度的“成本”时,调整的 才会增加。
调整的 的计算公式如下:
这个公式可以改写成与标准 直接相关的形式,这更便于理解其惩罚机制:
公式中的符号定义如下:
- :模型的标准决定系数。
- :样本量 (Sample Size),即观测点的数量。
- :模型中自变量(或称预测变量)的数量。
惩罚机制的解释:
- 公式中的 是关键的“惩罚因子”。
- 当一个自变量被添加到模型中时, 增加 1。
- 这使得分母 减小,从而导致整个惩罚因子 的值变大。
- 虽然增加变量会使 减小(因为 增加了),但这个减小的效应会乘以一个更大的惩罚因子。
- 最终结果:如果新加入的变量对模型解释力的提升(即对 的提升)不足以抵消惩罚因子的增大幅度,那么调整的 将会下降。反之,如果新变量的解释力足够强,调整的 则会上升。
如何解读和使用调整的R²
- 数值范围:调整的 总是小于或等于标准 。与 不同(其范围为 ),调整的 可能为负数。当模型的解释力甚至不如一个只包含截距项的基准模型(即用因变量的均值进行预测)时,调整的 就会是负值。
- 模型选择:调整的 最重要的应用是在多元回归分析 (Multiple Regression Analysis) 中进行模型选择 (Model Selection)。当比较两个或多个都使用相同因变量和相同数据集,但包含不同数量自变量的候选模型时,通常应选择具有 更高调整的 值的模型。这遵循了奥卡姆剃刀原则 (Occam's Razor),即在相似的解释力下,我们偏好更简洁的模型。
- 判断变量的有效性:当向模型中添加一个新变量后,若调整的 增加,则说明该变量为模型提供了有价值的额外信息;若调整的 减小,则说明该变量的加入弊大于利,它带来的模型复杂度超过了其微弱的解释力贡献,应考虑从模型中剔除。
示例说明
假设我们正在构建一个模型来预测房价,数据集包含 100 套房屋()。
- 模型A:只使用一个自变量“房屋面积”(平方米)。 \begin{itemize}
- 假设计算得出
\item 模型B:在模型A的基础上,增加一个有效的自变量“地段评分”(1-10分)。
- 这个变量很关键,假设它使 大幅提升至
- 结论:由于调整的 从 0.646 显著增加到 0.796,我们认为“地段评分”是一个非常有用的预测变量,模型B优于模型A。
\item 模型C:在模型B的基础上,再增加一个无关变量“前房主姓氏的字母数”。
- 这个变量几乎没有预测价值,假设它使 仅从 0.80 轻微增加到 。
- 结论:尽管标准 略有上升,但调整的 从 0.796 下降到了 0.795。这明确地告诉我们,增加“前房主姓氏的字母数”这个变量是不明智的,它使模型变得不必要地复杂而没有带来实质性的解释力提升。因此,在模型B和模型C之间,我们应选择更简洁且调整的 更高的模型B。
\end{itemize}
注意事项与局限性
- 调整的 与标准 一样,衡量的是相关性而非因果关系 (Causality)。
- 调整的 的高低没有绝对标准,一个“好”的调整 值取决于研究领域。在物理学中,0.95可能才算好;而在社会科学中,0.3可能已经非常有意义。
- 它对模型的其他潜在问题,如多重共线性 (Multicollinearity)、异方差性 (Heteroskedasticity) 或遗漏变量偏误 (Omitted Variable Bias) 并不敏感。
- 在模型选择中,调整的 是众多标准之一。其他常用的信息准则,如赤池信息准则 (Akaike Information Criterion, AIC) 和贝叶斯信息准则 (Bayesian Information Criterion, BIC),也通过不同的方式对模型复杂度进行惩罚,并且在理论上更为稳健,应结合使用。