知经百科 / Z

总平方和 (Sum of Squares Total, SST)

总平方和 (Sum of Squares Total, SST)

总平方和 (Sum of Squares Total,简称 SST) 是方差分析 (ANOVA) 和回归分析中最基本的平方和概念,用于度量因变量观测值相对于其均值的总变异程度。其定义为:

SST=i=1n(yiyˉ)2\text{SST} = \sum_{i=1}^{n} (y_i - \bar{y})^2

其中 yi y_i 是第 i i 个观测值,yˉ \bar{y} 是样本均值,n n 是样本容量。SST 衡量的是数据中所有观测值围绕其中心(均值)的离散程度——数值越大,表明数据的波动越剧烈;数值越小,表明数据越集中。在描述统计学中,SST 与方差 (Variance) 直接相关:样本方差 s2=SST/(n1) s^2 = \text{SST} / (n-1) ,而总体方差 σ2=SST/n \sigma^2 = \text{SST} / n 。因此,SST 本质上是一个未标准化的总变异量度。

平方和分解:核心恒等式

SST 的核心重要性来源于它在线性回归模型中的平方和分解恒等式。对于包含截距项的 OLS 回归模型 yi=β^0+β^1x1i++β^kxki+ei y_i = \hat{\beta}_0 + \hat{\beta}_1 x_{1i} + \cdots + \hat{\beta}_k x_{ki} + e_i ,总平方和可以分解为两个正交部分:

SST=SSE+SSR\text{SST} = \text{SSE} + \text{SSR}

其中:

  • 解释平方和 (Explained Sum of Squares, SSE):SSE=i=1n(y^iyˉ)2 \displaystyle \text{SSE} = \sum_{i=1}^{n} (\hat{y}_i - \bar{y})^2 ,度量回归拟合值 y^i \hat{y}_i 围绕 yˉ \bar{y} 的变异,即被模型解释的部分。
  • 残差平方和 (Residual Sum of Squares, SSR):SSR=i=1n(yiy^i)2 \displaystyle \text{SSR} = \sum_{i=1}^{n} (y_i - \hat{y}_i)^2 ,度量观测值与拟合值之间的偏离,即模型未能解释的随机误差部分。

这一分解的成立依赖于 OLS 的正交条件——残差与拟合值不相关、残差均值为零——其代数基础是 Pythagoras 定理在高维欧几里得空间中的推广。正交性保证了 SST、SSE 和 SSR 构成一个直角三角形关系,即 yyˉ12=y^yˉ12+e2 \lVert \mathbf{y} - \bar{y}\mathbf{1} \rVert^2 = \lVert \hat{\mathbf{y}} - \bar{y}\mathbf{1} \rVert^2 + \lVert \mathbf{e} \rVert^2

与可决系数的关系

SST 直接决定了可决系数 (R2 R^2 ) 的计算:

R2=SSESST=1SSRSSTR^2 = \frac{\text{SSE}}{\text{SST}} = 1 - \frac{\text{SSR}}{\text{SST}}

R2 R^2 衡量的是回归模型所能解释的变异占总变异的比例,取值在 [0,1] [0, 1] 之间。当 R2=1 R^2 = 1 时,SSR = 0,意味着模型完美拟合所有数据点;当 R2=0 R^2 = 0 时,SSE = 0,意味着模型完全不优于仅用均值进行的预测。

值得注意的是,在历元回归 (regression through the origin) 或不含截距项的模型中,上述 SST = SSE + SSR 的分解不再成立。此时若沿用 SST 的标准定义,R2 R^2 可能出现负值,因此需要采用未中心化的总平方和 yi2 \sum y_i^2 作为分母进行调整。

在 ANOVA 框架中的角色

单因素方差分析 (One-Way ANOVA) 中,SST 进一步分解为组间平方和 (SSB) 与组内平方和 (SSW):

SST=SSB+SSW\text{SST} = \text{SSB} + \text{SSW}

此处 SSB=j=1knj(yˉjyˉ)2 \text{SSB} = \sum_{j=1}^{k} n_j (\bar{y}_j - \bar{y})^2 度量各处理组均值与总均值的差异(即处理效应),而 SSW=j=1ki=1nj(yijyˉj)2 \text{SSW} = \sum_{j=1}^{k} \sum_{i=1}^{n_j} (y_{ij} - \bar{y}_j)^2 度量各组内部的随机波动(即误差)。F 统计量 正是基于这两部分平方元的比较:F=SSB/(k1)SSW/(nk) F = \frac{\text{SSB} / (k-1)}{\text{SSW} / (n-k)} 。SST 的自由度恒为 n1 n-1 ,对应着 n n 个观测值在估计一个均值参数后剩余的自由变动空间。

统计性质

  • 分布性质:若 yiN(μ,σ2) y_i \sim N(\mu, \sigma^2) 独立同分布,则 SST/σ2χn12 \text{SST} / \sigma^2 \sim \chi^2_{n-1} ,即标准化后的总平方和服从自由度为 n1 n-1 卡方分布。这是经典正态线性模型中所有推断的起点。
  • 期望E[SST]=(n1)σ2 \mathbb{E}[\text{SST}] = (n-1)\sigma^2 ,因此 s2=SST/(n1) s^2 = \text{SST} / (n-1) σ2 \sigma^2 的无偏估计。
  • 与协方差的关系:在多元回归中,SST 也可表达为 SST=i=1nyi2nyˉ2 \text{SST} = \sum_{i=1}^{n} y_i^2 - n\bar{y}^2 ,即原始平方和减去均值校正项。

实际应用中的注意事项

  1. 量纲敏感:SST 依赖于因变量的量纲——若将 y y 的单位从元改为万元,SST 会缩小 108 10^8 倍。因此 SST 本身在不同模型或不同数据之间不具有可比性,这正凸显了 R2 R^2 作为标准化指标的价值。
  2. 异常值影响:SST 对极端值高度敏感。单个远离均值的异常观测会平方级地推高 SST,进而影响 R2 R^2 和 F 统计量。因此在回归诊断中,需要同时检查 SST 在剔除异常值前后的变化。
  3. 样本量效应:随着样本量 n n 的增加,SST 通常也会增大(因为新增的观测值贡献额外的离差平方项)。但这并不表示模型拟合变差——R2 R^2 控制了量纲差异,更适合跨样本的比较。
  4. 零基线:当所有 yi y_i 相等时,SST = 0,此时数据不具有任何变异,回归分析失去意义。

与相关概念的区分

总平方和容易与以下概念混淆,需加以区分:

  • ESS (Explained Sum of Squares):有时文献中 ESS 表示"解释平方和"(即 SSE),但部分教材将 ESS 定义为"误差平方和"。读者应注意不同来源中的符号约定差异。
  • TSS (Total Sum of Squares):TSS 是 SST 的另一种通用英文缩写,两者含义完全相同,在计量经济学文献中常交替使用。
  • SS (Sum of Squares):广义上泛指任意二次型,但在 ANOVA 表格语境下通常特指某一种平方和。

在机器学习中的作用

机器学习回归任务中,SST 同样扮演着核心角色。均方误差 (MSE) 与 SST 的关系为:MSE=SSR/n \text{MSE} = \text{SSR} / n ,而 R2 R^2 作为模型评估的常用指标直接由 SST 和 SSR 计算得出。在决策树回归中,节点分裂准则往往涉及 SST 的减少量——每次分裂的目标是最大化 SSE 的增量(即最小化 SSR),从而降低组内异质性。在主成分分析 (PCA) 中,SST 对应于总方差,而主成分的解释方差比例正是类比于 R2 R^2 的概念。偏最小二乘法 (PLS) 等其他降维技术也围绕 SST 的分解逻辑展开。此外,SST 在交叉验证的误差分解中也有应用:总预测误差可分解为偏差平方、方差和不可约误差,这种偏差-方差分解 (Bias-Variance Decomposition) 与 SST 的分解思维一脉相承——追求模型在解释变异的同时避免过拟合。

总结

总平方和 (SST) 是统计学计量经济学中的基础概念,它量化了因变量的总变异,并通过平方和分解为拟合优度分析、方差分析假设检验提供了统一的数学框架。从 SST 衍生出的 R2 R^2 、F 统计量和方差估计构成了经典线性模型推断的三大支柱。理解 SST 的定义、分解及其分布性质,是掌握回归分析和方差分析全貌的必要前提。SST 的核心思想——将总变异拆解为可解释部分与不可解释部分——深刻影响了现代数据分析的方法论,从经典统计到机器学习均能找到其思想印记。

返回百科索引