知经百科 / T

Total Sum of Squares, SST

总平方和(Total Sum of Squares, SST),亦称总离差平方和,是统计学中衡量一组数据总变异程度的核心指标。该概念源自英国统计学家罗纳德·费希尔(Ronald Fisher)在20世纪初创立的方差分析理论,现已构成现代统计推断的基石之一。在方差分析(ANOVA)和线性回归分析的框架下,SST扮演着分解总变异、评估模型解释力的基础性角色。其定义为每个观测值与其总体均值之差的平方和,数学表达式为:

SST=i=1n(yiyˉ)2SST = \sum_{i=1}^{n} (y_i - \bar{y})^2

其中 yi y_i 为第 i i 个观测值,yˉ \bar{y} 为样本均值,n n 为样本量。SST 的大小直接反映了数据点在均值周围的离散程度——SST 越大,说明观测值之间的差异越大,数据的整体波动性越强。

平方和分解

在线性回归模型中,SST 可以被分解为两个具有明确统计含义的组成部分:回归平方和(Sum of Squares due to Regression, SSR)与残差平方和(Sum of Squared Errors, SSE)。这一分解构成了方差分析的基础。

设有线性回归模型 y^i=β^0+β^1xi \hat{y}_i = \hat{\beta}_0 + \hat{\beta}_1 x_i ,则总平方和可写为:

i=1n(yiyˉ)2=i=1n(y^iyˉ)2+i=1n(yiy^i)2\sum_{i=1}^{n} (y_i - \bar{y})^2 = \sum_{i=1}^{n} (\hat{y}_i - \bar{y})^2 + \sum_{i=1}^{n} (y_i - \hat{y}_i)^2

即:

SST=SSR+SSESST = SSR + SSE
  • 回归平方和(SSR):度量由回归模型解释的那部分变异,即预测值 y^i \hat{y}_i 围绕均值 yˉ \bar{y} 的波动。SSR 越大,说明模型对因变量变异的解释能力越强。当自变量与因变量之间存在强线性关系时,SSR 在 SST 中占据主导地位。
  • 残差平方和(SSE):度量模型未能解释的剩余变异,即实际观测值 yi y_i 与预测值 y^i \hat{y}_i 之间的偏差平方和。SSE 越小,说明模型的拟合精度越高。SSE 包含了随机误差以及可能的模型设定误差。

这一分解式的核心意义在于,它将总变异分割为"模型可以解释的部分"和"模型无法解释的部分",为评估模型拟合优度提供了直接的量化工具。

决定系数 R²

由 SST、SSR 和 SSE 三者之间的关系可以直接导出决定系数 R2 R^2 ,它是回归分析中最常用的拟合优度指标:

R2=SSRSST=1SSESSTR^2 = \frac{SSR}{SST} = 1 - \frac{SSE}{SST}

R2 R^2 的取值范围在 0 到 1 之间,解释为回归模型所能解释的因变量总变异所占的比例。当 R2=1 R^2 = 1 时,SSE=0 SSE = 0 ,表明模型完全拟合数据;当 R2=0 R^2 = 0 时,SSR=0 SSR = 0 ,表明模型没有任何解释力,预测值恒等于均值。需要特别注意的是,在多元回归中增加自变量总会提高 R2 R^2 ,即使新增变量对因变量并无实际解释力,因此统计学家引入了调整后的 R2 R^2 (Adjusted R2 R^2 )以惩罚不必要的模型复杂度。调整后的 R2 R^2 将自由度纳入考量,其计算公式为 Rˉ2=1SSE/(np1)SST/(n1) \bar{R}^2 = 1 - \frac{SSE/(n-p-1)}{SST/(n-1)} ,这一指标在模型选择中比普通 R2 R^2 更为可靠。

方差分析中的 SST

在单因素方差分析(One-way ANOVA)的情境中,总平方和同样可以分解,但形式略有不同。设有 k k 个处理组,每组 nj n_j 个观测值,总样本量为 N=j=1knj N = \sum_{j=1}^{k} n_j ,则:

SST=j=1ki=1nj(yijyˉ)2SST = \sum_{j=1}^{k} \sum_{i=1}^{n_j} (y_{ij} - \bar{y})^2

这一总平方和可分解为组间平方和(Sum of Squares Between Groups, SSB)与组内平方和(Sum of Squares Within Groups, SSW):

SST=SSB+SSWSST = SSB + SSW
  • 组间平方和(SSB):各组的样本均值 yˉj \bar{y}_j 与总均值 yˉ \bar{y} 的加权离差平方和,反映不同处理组之间的差异。
  • 组内平方和(SSW):各组内部观测值 yij y_{ij} 与该组均值 yˉj \bar{y}_j 的离差平方和,反映随机误差或个体差异。

通过比较 SSB 与 SSW 的相对大小,可以构造 F F 统计量来检验各组的均值是否存在显著差异。F 检验的基本逻辑是:如果处理效应真实存在,组间变异应显著大于组内变异。F F 统计量的计算公式为 F=SSB/(k1)SSW/(Nk)=MSBMSW F = \frac{SSB/(k-1)}{SSW/(N-k)} = \frac{MSB}{MSW} ,服从自由度为 (k1,Nk) (k-1, N-k) F F 分布。当计算得到的 F F 值大于给定显著性水平下的临界值时,拒绝原假设,认为至少有两个处理组的均值存在显著差异。这一过程的本质正是对 SST 所代表的总体变异进行结构分解后所做的假设检验。

自由度与均方

SST 对应的自由度为 n1 n - 1 (一个约束条件来自样本均值 yˉ \bar{y} )。将平方和除以其对应的自由度即得到均方(Mean Square, MS):

MST=SSTn1MST = \frac{SST}{n-1}

在回归分析中,MSR=SSR/p MSR = SSR / p p p 为自变量个数),MSE=SSE/(np1) MSE = SSE / (n - p - 1) 。在 ANOVA 中,MSB=SSB/(k1) MSB = SSB / (k - 1) MSW=SSW/(Nk) MSW = SSW / (N - k) F F 统计量正是组间/回归均方与组内/残差均方的比值。

计算示例

考虑一个简单的例子:假设五个学生的考试成绩分别为 70、80、85、90、95。计算得到均值 yˉ=84 \bar{y} = 84 ,则 SST 的计算过程如下:

SST=(7084)2+(8084)2+(8584)2+(9084)2+(9584)2SST = (70-84)^2 + (80-84)^2 + (85-84)^2 + (90-84)^2 + (95-84)^2
=(14)2+(4)2+(1)2+(6)2+(11)2= (-14)^2 + (-4)^2 + (1)^2 + (6)^2 + (11)^2
=196+16+1+36+121=370= 196 + 16 + 1 + 36 + 121 = 370

若利用简单线性回归以学习时间(单位:小时)预测成绩,得到 SSR = 333、SSE = 37,则 R2=333/3700.90 R^2 = 333 / 370 \approx 0.90 ,表明学习时间可以解释成绩变异的约 90\%,拟合效果良好。这一数值说明该线性模型具有较强的预测能力。

局限与扩展

SST 作为总变异的度量,在应用中需要注意以下几点:第一,SST 对异常值非常敏感,单个极端值可能大幅推高总平方和,影响后续分解与推断的可靠性。第二,SST 的大小依赖于数据的量纲和测量尺度,不同数据集的 SST 不能直接比较。第三,在高维数据或非线性模型中,SST 的简单线性分解不再成立,需要引入更复杂的变异分解方法,如核方法或主成分分析。第四,SST 衡量的是围绕均值的离散程度,对于偏态分布或多峰分布,均值本身的代表性有限,此时需结合其他统计量综合判断。

在实际应用中,SST 不仅服务于传统的回归和方差分析,还是结构方程建模(Structural Equation Modeling)、潜在变量分析和机器学习模型评估的重要基石。例如,在神经网络回归任务中,R2 R^2 仍常作为评价预测精度的辅助指标。在时间序列分析中,SST 的分解逻辑被推广为趋势成分、季节成分、周期成分和随机成分的分离,这种分解方法被称为时间序列的经典分解法。深入理解 SST 的内涵与局限性,是正确运用统计推断工具的前提。

返回百科索引