TSS:总离差平方和 (Total Sum of Squares)
TSS,全称为 总离差平方和 (Total Sum of Squares),也常记作 SST (Sum of Squares Total),是 计量经济学 和 统计学 中衡量数据总变异程度的核心统计量。在 线性回归 的框架下,TSS 量化了被解释变量 Y 围绕其样本均值 Yˉ 的总波动幅度,构成了模型拟合优度评估和方差分析的基石。
直观而言,如果我们将所有观测值 Yi 与其均值 Yˉ 的偏差看作数据的"总信息量",TSS 就是这一信息量的平方和度量。回归分析的根本任务——用解释变量去"解释" Y 的变异——在代数上等价于将 TSS 分解为可解释部分与不可解释部分之和。
定义与基本公式
设有 n 个观测值 Y1,Y2,…,Yn,样本均值为 Yˉ=n1∑i=1nYi。TSS 定义为每个观测值偏离样本均值的离差平方之和:
TSS=i=1∑n(Yi−Yˉ)2
TSS 始终非负。当且仅当所有 Yi 完全相等时,TSS=0。TSS 越大,表明数据围绕均值的离散程度越高。
TSS 与样本方差 sY2 存在直接关系:
sY2=n−1TSS
因此 TSS 本质上就是样本方差的分子部分,除以自由度 n−1 后即为 Y 的无偏方差估计量。
平方和分解:TSS = ESS + RSS
在 普通最小二乘法 (OLS) 回归中,TSS 的核心价值体现在其与另外两个平方和之间的恒等分解关系上。设回归模型为:
Yi=β0+β1Xi1+⋯+βkXik+εi,i=1,…,n
OLS 估计给出拟合值 Y^i=β^0+β^1Xi1+⋯+β^kXik 和残差 ε^i=Yi−Y^i。则有如下代数恒等式:
TSSi=1∑n(Yi−Yˉ)2=ESSi=1∑n(Y^i−Yˉ)2+RSSi=1∑n(Yi−Y^i)2
其中:
- ESS (Explained Sum of Squares,回归平方和):衡量回归模型所解释的变异——拟合值 Y^i 围绕均值 Yˉ 的波动。反映解释变量 X 对 Y 的联合解释力。
- RSS (Residual Sum of Squares,残差平方和):衡量模型未能解释的残余变异——观测值偏离回归超平面的部分。反映随机误差和遗漏变量的影响。
该分解之所以成立,依赖于 OLS 的正交性:残差向量 ε^ 与拟合值向量 Y^ 正交,且残差之和为零(当模型包含截距项时)。从交叉项看:
∑(Yi−Yˉ)2=∑(Y^i−Yˉ+Yi−Y^i)2=∑(Y^i−Yˉ)2+∑(Yi−Y^i)2+2∑(Y^i−Yˉ)(Yi−Y^i)
OLS 一阶条件保证了交叉项 ∑(Y^i−Yˉ)ε^i=0,因此分解为严格等式。
自由度分解
平方和分解对应着自由度的平行分解。TSS 的自由度为 n−1(因为计算 Yˉ 消耗了一个自由度);ESS 的自由度为 k(回归中解释变量的个数);RSS 的自由度为 n−k−1(样本量减去待估参数个数)。三者满足:
dfTSS=dfESS+dfRSS,即 n−1=k+(n−k−1)
这一分解直接导向 ANOVA 表和 F 检验。
ANOVA 表中的 TSS
在回归输出的 方差分析表 (ANOVA Table) 中,TSS 是总变异的来源行:
变异来源回归 (Model)残差 (Residual)总计 (Total)平方和 (SS)ESSRSSTSS自由度 (df)kn−k−1n−1均方 (MS)ESS/kRSS/(n−k−1)FMSR/MSE
其中 MSR=ESS/k 为回归均方,MSE=RSS/(n−k−1) 为残差均方。F检验 统计量 F=MSR/MSE 用于检验全部解释变量的联合显著性:H0:β1=β2=⋯=βk=0。
与拟合优度 R² 的关系
TSS 最广为人知的应用在于定义 决定系数 R2(拟合优度 R²):
R2=TSSESS=1−TSSRSS
R2 的解释直接依赖于 TSS:它衡量了回归模型所解释的变异占 Y 总变异的比例。R2 介于 0 和 1 之间(在含截距项的 OLS 中),当 ESS=TSS(即 RSS=0,完美拟合)时 R2=1;当 ESS=0(即 Y^i=Yˉ 对所有 i 成立,模型无解释力)时 R2=0。
注意到 调整 R2(Adjusted R-squared)同样基于 TSS 构建,通过对自由度进行惩罚来修正变量增加带来的机械性 R2 提升:
Rˉ2=1−TSS/(n−1)RSS/(n−k−1)
当 n 较大而 k 较小时,Rˉ2 与 R2 接近;当模型中加入无关变量时,Rˉ2 可能反而下降,从而起到模型选择中的惩罚作用。
几何解释:正交投影
从线性代数角度看,TSS-ESS-RSS 分解是 正交投影 的自然结果。记 Y=(Y1,…,Yn)′,Yˉ=(Yˉ,…,Yˉ)′ 为均值向量,X 为 n×(k+1) 设计矩阵(含截距列)。OLS 拟合值 Y^=X(X′X)−1X′Y=PY,其中 P 为投影矩阵。
在 Rn 空间中:
- Y−Yˉ:原始数据去均值后的向量,其平方长度为 TSS。
- Y^−Yˉ=PY−Yˉ:该向量在 X 列空间(扣除截距方向)上的投影,其平方长度为 ESS。
- Y−Y^=(I−P)Y:残差向量,落在 X 列空间的正交补中,平方长度为 RSS。
投影矩阵的正交性(P 为对称幂等矩阵)保证了毕达哥拉斯分解:∥Y−Yˉ∥2=∥Y^−Yˉ∥2+∥Y−Y^∥2,即 TSS=ESS+RSS。
不含截距项回归中的注意事项
当回归模型不含截距项(即 β0 被强制设为零)时,上述经典分解 TSS=ESS+RSS 不一定成立。原因在于 OLS 一阶条件不再保证残差之和为零,交叉项 ∑(Y^i−Yˉ)ε^i 可能非零。此时应使用未中心化的 TSS(即 ∑Yi2 而非 ∑(Yi−Yˉ)2)进行分解,且 R2 的定义也需相应调整。
推广:广义线性模型与非线性模型
TSS 的概念可以推广到更一般的建模框架中。在 非线性回归 和 广义线性模型 (GLM) 中,虽然 OLS 的正交分解不再严格成立,但"总变异"的概念仍然适用。常用的广义 R2 度量(如 McFadden R2、Nagelkerke R2)均在不同意义上将模型的对数似然值与仅含截距的基准模型进行比较,其构造逻辑与 TSS 作为基准变异的思想一脉相承。
在 方差分析 (ANOVA) 中,TSS 的概念直接推广为总平方和 SSTotal,其分解为组间平方和 SSBetween 与组内平方和 SSWithin 之和,构成 F 检验的基础。
报告与解读中的常见误区
- TSS 大不等于模型好:TSS 仅反映 Y 的固有变异性,与模型质量无关。一个 TSS 很大的数据集可能本身就具有高度离散性(如股票收益率),回归的 R2 仍然可能很低。
- 不同数据集的 TSS 不可直接比较:TSS 的量纲是 Y 量纲的平方,且依赖于样本量 n。比较不同数据集的总变异应使用方差 sY2 或变异系数。
- 添加无关变量不会改变 TSS:TSS 仅由 Y 的观测值和样本均值决定,与模型中包含哪些解释变量完全无关。无论模型设定如何变化,TSS 始终保持不变。
- 时间序列中的 TSS:在 ARIMA 等时间序列模型中,TSS 的定义与截面回归一致,但由于序列相关性的存在,自由度的计算和 F 检验的适用性需要谨慎处理(参见 Durbin-Watson 检验)。
TSS 作为回归分析的起点统计量,虽然定义简单,却承载着连接描述性统计、模型诊断和统计推断的枢纽作用。理解 TSS 及其分解,是深入掌握 OLS、假设检验 和模型评价体系的必经之路。