知经百科 / Z

总平方和 (SST)

总平方和 (Total Sum of Squares)

总平方和(Total Sum of Squares,简称 SST)是回归分析方差分析中衡量因变量总变异量的核心指标。在回归模型 yi=β^0+β^1xi+eiy_i = \hat{\beta}_0 + \hat{\beta}_1 x_i + e_i 中,SST 定义为因变量各观测值 yiy_i 与其均值 yˉ\bar{y} 之差的平方和:

SST=i=1n(yiyˉ)2\text{SST} = \sum_{i=1}^{n} (y_i - \bar{y})^2

其中 nn 为样本容量,yˉ=1ni=1nyi\bar{y} = \frac{1}{n}\sum_{i=1}^{n} y_i。SST 刻画了因变量在样本中的总波动程度。SST 越大,说明观测值在均值周围的离散程度越高;SST 越小则观测值越集中于均值。SST 除以自由度 n1n-1 得到因变量的样本方差 sy2=SST/(n1)s_y^2 = \text{SST}/(n-1),揭示 SST 与方差概念的内在联系——SST 本质上是未除以自由度的离差平方和。

平方和分解

SST 的核心意义在于它可分解为两部分:回归平方和(Sum of Squares of Regression,简称 SSR)与残差平方和(Sum of Squared Errors,简称 SSE)。数学表达式为:

SST=SSR+SSE\text{SST} = \text{SSR} + \text{SSE}

其中 SSR=i=1n(y^iyˉ)2\text{SSR} = \sum_{i=1}^{n} (\hat{y}_i - \bar{y})^2 衡量模型解释的变异量,SSE=i=1n(yiy^i)2\text{SSE} = \sum_{i=1}^{n} (y_i - \hat{y}_i)^2 衡量模型无法解释的残余变异量。普通最小二乘法(OLS)保证这一分解成立,前提是模型中包含截距项。该分解之所以成立,是因为 OLS 的正交条件保证了残差与拟合值不相关,且残差之和为零。

从向量几何角度看,SST 对应因变量向量 y\mathbf{y}(中心化后)的欧几里得范数平方。SSR 是 y\mathbf{y} 在模型解释变量张成的列空间上投影的范数平方,SSE 则是该投影的残差向量(正交于解释变量空间)的范数平方。三者满足勾股定理关系:

yyˉ12=y^yˉ12+yy^2\|\mathbf{y} - \bar{y}\mathbf{1}\|^2 = \|\hat{\mathbf{y}} - \bar{y}\mathbf{1}\|^2 + \|\mathbf{y} - \hat{\mathbf{y}}\|^2

这一几何视角将 SST 的分解直观化为高维空间中的直角三角形关系,是理解线性回归代数本质的关键。

决定系数 R2R^2

基于 SST 和 SSE(或 SSR),可定义回归模型的决定系数

R2=SSRSST=1SSESSTR^2 = \frac{\text{SSR}}{\text{SST}} = 1 - \frac{\text{SSE}}{\text{SST}}

R2R^2 的值域为 [0,1][0, 1],表示因变量的总变异中能被模型解释的比例。R2=1R^2 = 1 时模型完美拟合所有观测点(SSE = 0);R2=0R^2 = 0 时模型完全无法解释因变量变异(SSR = 0,即模型预测值恒等于 yˉ\bar{y})。在多元线性回归中,增加解释变量会机械地提高 R2R^2,故常使用经自由度调整的调整 R2R^2

Rˉ2=1SSE/(nk)SST/(n1)\bar{R}^2 = 1 - \frac{\text{SSE} / (n - k)}{\text{SST} / (n - 1)}

其中 kk 为模型中参数个数(含截距项)。调整 R2R^2 通过对均方而非平方和取比,惩罚了不必要的解释变量。

与方差分析的关系

方差分析(ANOVA)中,SST 同样扮演核心角色。单因素方差分析将总变异分解为组间平方和(SSB,即处理效应导致的变异)与组内平方和(SSW,即随机误差导致的变异):SST=SSB+SSW\text{SST} = \text{SSB} + \text{SSW}。F 检验统计量正是基于 SSB 与 SSW 的比值构造:

F=SSB/(k1)SSW/(nk)F = \frac{\text{SSB} / (k - 1)}{\text{SSW} / (n - k)}

其中 kk 为组数。这一分解框架是实验设计假设检验的理论基础。在回归分析的 ANOVA 表中,SST 对应的行通常列在表格最下方,作为总变异的基准参考值;SSR 和 SSE 则分别对应回归模型和残差项,帮助研究者评估模型的整体显著性。

自由度和均方

与 SST 对应的自由度是 n1n - 1(因中心化损失一个自由度)。将 SST 除以自由度得总均方(Total Mean Square):

MST=SSTn1\text{MST} = \frac{\text{SST}}{n - 1}

MST 实际上就是因变量样本方差的无偏估计量。在回归语境中,SSR 的自由度为 k1k - 1kk 为参数个数含截距),SSE 的自由度为 nkn - k。回归均方 MSR=SSR/(k1)\text{MSR} = \text{SSR} / (k - 1) 与残差均方 MSE=SSE/(nk)\text{MSE} = \text{SSE} / (n - k) 之比即为回归 F 统计量:

F=MSRMSE=SSR/(k1)SSE/(nk)F = \frac{\text{MSR}}{\text{MSE}} = \frac{\text{SSR} / (k - 1)}{\text{SSE} / (n - k)}

该统计量用于检验回归模型的整体显著性(即所有斜率系数是否同时为零)。MST 虽不直接出现在 F 检验中,但作为 SST 的标准化形式,它为各平方和提供了可比较的尺度。

计算示例

考虑因变量 y=[2,4,9,8,7]y = [2, 4, 9, 8, 7] 与自变量 x=[1,2,3,4,5]x = [1, 2, 3, 4, 5]。均值 yˉ=6\bar{y} = 6。OLS 回归得 y^=[3.4,4.7,6.0,7.3,8.6]\hat{y} = [3.4, 4.7, 6.0, 7.3, 8.6]。SST、SSR 与 SSE 计算如下:

SST=(26)2+(46)2+(96)2+(86)2+(76)2=16+4+9+4+1=34SSR=(3.46)2+(4.76)2+(6.06)2+(7.36)2+(8.66)2=6.76+1.69+0+1.69+6.76=16.90SSE=(23.4)2+(44.7)2+(96.0)2+(87.3)2+(78.6)2=1.96+0.49+9.00+0.49+2.56=14.50\begin{aligned} \text{SST} &= (2-6)^2 + (4-6)^2 + (9-6)^2 + (8-6)^2 + (7-6)^2 \\ &= 16 + 4 + 9 + 4 + 1 = 34 \\ \text{SSR} &= (3.4-6)^2 + (4.7-6)^2 + (6.0-6)^2 + (7.3-6)^2 + (8.6-6)^2 \\ &= 6.76 + 1.69 + 0 + 1.69 + 6.76 = 16.90 \\ \text{SSE} &= (2-3.4)^2 + (4-4.7)^2 + (9-6.0)^2 + (8-7.3)^2 + (7-8.6)^2 \\ &= 1.96 + 0.49 + 9.00 + 0.49 + 2.56 = 14.50 \end{aligned}

验证得 SSR+SSE=16.90+14.50=31.40\text{SSR} + \text{SSE} = 16.90 + 14.50 = 31.40,与 SST = 34 略有差异,系四舍五入所致。精确计算下 SST = SSR + SSE 严格成立,体现 OLS 平方和分解的数学精确性。

返回百科索引