知经百科 / Z

总离差平方和

总离差平方和 (Total Sum of Squares, TSS)

总离差平方和(Total Sum of Squares,简称 TSS,部分教材亦记为 SST),是回归分析、方差分析与多元统计中度量数据总变异程度的核心统计量。它定义为被解释变量各观测值偏离其样本均值的平方和:

TSS=i=1n(yiyˉ)2\mathrm{TSS} = \sum_{i=1}^{n} (y_i - \bar{y})^2

其中 yi y_i 为第 i i 个观测值,yˉ=1ni=1nyi \bar{y} = \frac{1}{n} \sum_{i=1}^{n} y_i 为样本均值,n n 为样本容量。TSS 量化了因变量在未引入任何解释变量之前的"原始"波动幅度:TSS 越大,数据散布越广,潜在可解释的信息越丰富。

TSS 与样本方差 sy2 s^2_y 之间存在直接换算关系:sy2=TSS/(n1) s^2_y = \mathrm{TSS} / (n - 1) ,即 TSS 就是方差乘以自由度。这一关系揭示:TSS 同时承载了数据离散度的描述性统计功能和变异分解的推断性统计功能——它既是刻画分布的参数,也是假设检验的基石。

平方和分解:TSS = ESS + RSS

总离差平方和最重要的理论性质是其正交可分解性。在包含截距项的普通最小二乘法 (OLS)线性回归中,每个观测值的总离差可分解为两部分:

yiyˉ=(y^iyˉ)+(yiy^i)y_i - \bar{y} = (\hat{y}_i - \bar{y}) + (y_i - \hat{y}_i)

其中 y^i=xiβ^ \hat{y}_i = \mathbf{x}_i' \hat{\boldsymbol{\beta}} 为拟合值。对上述恒等式两边平方后求和,交叉项因正规方程 (Normal Equations)而消为零:

i=1n(y^iyˉ)(yiy^i)=y^ieiyˉei=00=0\sum_{i=1}^{n} (\hat{y}_i - \bar{y})(y_i - \hat{y}_i) = \sum \hat{y}_i e_i - \bar{y}\sum e_i = 0 - 0 = 0

其中残差 ei=yiy^i e_i = y_i - \hat{y}_i 满足 ei=0 \sum e_i = 0 y^iei=0 \sum \hat{y}_i e_i = 0 (拟合值与残差正交)。于是得到平方和分解的恒等式:

TSS=ESS+RSS\mathrm{TSS} = \mathrm{ESS} + \mathrm{RSS}

三项各自的含义如下:

  • ESS (Explained Sum of Squares) / 回归平方和ESS=i=1n(y^iyˉ)2 \mathrm{ESS} = \sum_{i=1}^{n} (\hat{y}_i - \bar{y})^2 。度量了回归模型解释掉的那部分变异——即因变量的条件期望随自变量变动而产生的系统波动。ESS 越大,说明自变量对因变量的解释力越强。
  • RSS (Residual Sum of Squares) / 残差平方和RSS=i=1n(yiy^i)2=ei2 \mathrm{RSS} = \sum_{i=1}^{n} (y_i - \hat{y}_i)^2 = \sum e_i^2 。度量了模型未能解释的剩余变异,即噪声或模型设定偏误所导致的误差。OLS 估计的核心正是最小化 RSS。
  • TSS 的角色:TSS 是上述二者的总和,提供了衡量"多少变异被解释、多少未被解释"的基准。没有 TSS,ESS 和 RSS 都只是绝对量而非比例,无法在不同数据集间横向比较。

与判定系数 R2 R^2 的关系

总离差平方和是定义判定系数 (R2 R^2 ) 的分母,R2 R^2 的经典定义为:

R2=ESSTSS=1RSSTSSR^2 = \frac{\mathrm{ESS}}{\mathrm{TSS}} = 1 - \frac{\mathrm{RSS}}{\mathrm{TSS}}

R2[0,1] R^2 \in [0, 1] (在含截距模型中),衡量了因变量总变异中被模型解释的比例。理解 R2 R^2 必须理解 TSS 的角色:TSS 作为标准化分母使得解释力的度量成为比例。若两个模型的因变量不同,其 TSS 不同,则二者的 R2 R^2 不可直接比较——因为同样的 RSS 在 TSS 更大的数据集中对应更高的 R2 R^2

进一步地,调整 R2 R^2 (Adjusted R-squared) 在 TSS 和 RSS 之外引入了自由度惩罚:

Rˉ2=1RSS/(nk1)TSS/(n1)\bar{R}^2 = 1 - \frac{\mathrm{RSS} / (n - k - 1)}{\mathrm{TSS} / (n - 1)}

其中 k k 为自变量个数。无论 R2 R^2 还是 Rˉ2 \bar{R}^2 ,TSS 始终作为分母中的基准不变量而存在。

自由度与 ANOVA 表

TSS 的自由度为 n1 n - 1 :因为计算 yˉ \bar{y} 用掉一个自由度,剩余的 n1 n - 1 个独立离差构成了 TSS。平方和分解在自由度层面同样成立:

dfTSS=dfESS+dfRSS,n1=k+(nk1)df_{\mathrm{TSS}} = df_{\mathrm{ESS}} + df_{\mathrm{RSS}}, \quad \text{即} \quad n - 1 = k + (n - k - 1)

这一分解构成 ANOVA 表 的核心框架:

来源平方和 (SS)自由度 (df)均方 (MS)回归 (Model)ESSkMSR=ESS/k残差 (Error)RSSnk1MSE=RSS/(nk1)总计 (Total)TSSn1\begin{array}{c|c|c|c} \text{来源} & \text{平方和 (SS)} & \text{自由度 (df)} & \text{均方 (MS)} \\ \hline \text{回归 (Model)} & \mathrm{ESS} & k & \mathrm{MSR} = \mathrm{ESS} / k \\ \text{残差 (Error)} & \mathrm{RSS} & n - k - 1 & \mathrm{MSE} = \mathrm{RSS} / (n - k - 1) \\ \text{总计 (Total)} & \mathrm{TSS} & n - 1 & — \end{array}

整体显著性 F 检验 (F-test) 的统计量为 F=MSR/MSE F = \mathrm{MSR} / \mathrm{MSE} ,在零假设(所有斜率系数同时为零)下服从 F(k,nk1) F(k, n - k - 1) 分布。TSS 在此架构中既锚定了总变异的量级,也通过自由度分解为均方提供了基准。

方差分析(ANOVA)中的推广

总离差平方和的概念远不限于回归分析,它在方差分析 (Analysis of Variance, ANOVA)中承担着相同的基础角色。单因素 ANOVA 将 TSS 按变异来源分解为:

TSS=SSbetween+SSwithin\mathrm{TSS} = \mathrm{SS_{between}} + \mathrm{SS_{within}}

其中 SSbetween=j=1Jnj(yˉjyˉ)2 \mathrm{SS_{between}} = \sum_{j=1}^{J} n_j (\bar{y}_j - \bar{y})^2 (组间平方和),SSwithin=j=1Ji=1nj(yijyˉj)2 \mathrm{SS_{within}} = \sum_{j=1}^{J} \sum_{i=1}^{n_j} (y_{ij} - \bar{y}_j)^2 (组内平方和),J J 为组数。这一分解的逻辑与回归分析完全同构:将总变异"归因"于可识别的来源(分组因素 vs. 随机误差),并据此检验各组均值是否相等。

在多因素 ANOVA 和析因设计中,TSS 被进一步细分为主效应、交互效应和误差,每一来源对应各自的平方和与自由度,但 TSS 作为所有来源平方和的上限保持不变。无论实验设计如何复杂,TSS 始终是所有变异分解的求和上限。

几何解释

Rn \mathbb{R}^n 空间中,TSS 具有清晰的几何含义。将观测向量 y=(y1,,yn) \mathbf{y} = (y_1, \dots, y_n)' 、均值向量 yˉ=(yˉ,,yˉ) \bar{\mathbf{y}} = (\bar{y}, \dots, \bar{y})' 和拟合向量 y^=Xβ^=Hy \hat{\mathbf{y}} = \mathbf{X}\hat{\boldsymbol{\beta}} = \mathbf{H}\mathbf{y} (其中 H \mathbf{H} 帽子矩阵 (Hat Matrix))代入:

TSS=yyˉ2,ESS=y^yˉ2,RSS=yy^2\mathrm{TSS} = \|\mathbf{y} - \bar{\mathbf{y}}\|^2, \quad \mathrm{ESS} = \|\hat{\mathbf{y}} - \bar{\mathbf{y}}\|^2, \quad \mathrm{RSS} = \|\mathbf{y} - \hat{\mathbf{y}}\|^2

yˉ \bar{\mathbf{y}} y \mathbf{y} 在常数向量 (1,1,,1) (1,1,\dots,1)' 张成的一维子空间上的投影,而 y^ \hat{\mathbf{y}} y \mathbf{y} X X 的列空间(含常数向量)上的投影。由投影的嵌套关系可得:yy^ \mathbf{y} - \hat{\mathbf{y}} 垂直于 X X 的列空间,y^yˉ \hat{\mathbf{y}} - \bar{\mathbf{y}} 在该列空间内,故二者正交。平方和分解 TSS=ESS+RSS \mathrm{TSS} = \mathrm{ESS} + \mathrm{RSS} 本质上就是 Rn \mathbb{R}^n 中的勾股定理:残差、回归效应、总离差构成一个直角三角形。这一几何图像为所有线性模型的变异分解提供了统一直觉,也是理解Frisch-Waugh-Lovell 定理和部分回归图等进阶工具的几何起点。

注意事项与常见误区

  1. 无截距回归:若模型不含截距项,ei=0 \sum e_i = 0 不再被 OLS 正规方程所保证,交叉项未必为零,平方和分解 TSS=ESS+RSS \mathrm{TSS} = \mathrm{ESS} + \mathrm{RSS} 可能失效。此时基于该分解计算的 R2 R^2 可正可负,需使用非中心化 R2 R^2 (uncentered R2 R^2 ),即 ESS/yi2 \mathrm{ESS} / \sum y_i^2
  2. 因变量变换:对 y y 进行对数化、Box-Cox 变换等非线性变换后,TSS 在变换前后的尺度改变,R2 R^2 不可直接比较。这是因为 TSS 本身依赖于 y y 的度量单位,变换会重新定义"总变异"的内涵。
  3. 加权回归:在广义最小二乘法 (GLS) 或加权最小二乘法中,需使用加权 TSS:TSSw=wi(yiyˉw)2 \mathrm{TSS}_w = \sum w_i (y_i - \bar{y}_w)^2 ,其中 yˉw \bar{y}_w 为加权均值。加权 TSS 保证了平方和分解在异方差结构下的正确性。
  4. 高维数据:当 nk+1 n \leq k + 1 时,OLS 可实现 RSS = 0(完美拟合),此时 R2=1 R^2 = 1 ,但模型严重过拟合。TSS 作为分母并不惩罚模型复杂度,这恰恰是 Rˉ2 \bar{R}^2 和交叉验证等方法的引入动机。
  5. 记号差异:不同学科和教材对平方和的缩写存在差异——经济学常用 TSS、ESS、RSS,统计学部分教材用 SST、SSR、SSE,使用时需核对上下文以免混淆。

思想渊源与统计遗产

"离差平方和"这一概念的思想根基可追溯至十九世纪初。卡尔·弗里德里希·高斯 (Carl Friedrich Gauss)阿德里安-马里·勒让德 (Adrien-Marie Legendre) 各自独立发展出最小二乘法时,其核心操作恰恰是最小化残差平方和——即 TSS 中未被解释的那一部分。卡尔·皮尔逊 (Karl Pearson) 在二十世纪初奠定相关与回归分析的数学框架时,将总变异分解为可解释与不可解释两部分的思想成为贯穿其工作的主线。其后,罗纳德·费希尔 (Ronald Fisher) 在二十世纪二十年代创立方差分析法,将"总变异 = 组间变异 + 组内变异"的分解逻辑系统化,使 TSS 成为实验设计与统计推断的标配工具。

从计算方法论的角度看,TSS 可通过恒等式简化计算:TSS=yi2nyˉ2=yi21n(yi)2 \mathrm{TSS} = \sum y_i^2 - n \bar{y}^2 = \sum y_i^2 - \frac{1}{n}(\sum y_i)^2 。这一等价形式在手工计算时代极大降低了运算负担——只需一次遍历即可累积 yi \sum y_i yi2 \sum y_i^2 ,无需先算均值再返回算离差。现代统计软件虽不再受计算量约束,但该恒等在理解 TSS 与原始数据的数值关系时仍有启发价值。

返回百科索引