知经百科 / Z

总平方和 (Total Sum of Squares, SST)

总平方和 (Total Sum of Squares, SST)

总平方和 (Total Sum of Squares,简称 SST 或 TSS) 是方差分析 (ANOVA) 和回归分析中最基本的变异度量指标。它定义为因变量 yiy_i 的各观测值与其算术均值 yˉ\bar{y} 之差的平方和:SST=i=1n(yiyˉ)2\text{SST} = \sum_{i=1}^{n} (y_i - \bar{y})^2。SST 量化了因变量的总变异 (total variation),即在不引入任何解释变量的情况下,数据围绕其中心位置的自然离散程度。在普通最小二乘法 (OLS) 框架下,SST 被分解为回归平方和 (ESS) 与残差平方和 (RSS) 两部分,由此构建出评价线性回归拟合优度的核心统计量——决定系数 (R2R^2)。

定义与计算

设样本量为 nn,因变量观测值为 y1,y2,,yny_1, y_2, \ldots, y_n,样本均值为 yˉ=1ni=1nyi\bar{y} = \frac{1}{n}\sum_{i=1}^n y_i,则总平方和的数学表达式为:

SST=i=1n(yiyˉ)2\text{SST} = \sum_{i=1}^{n} (y_i - \bar{y})^2

展开等价形式为:

SST=i=1nyi2nyˉ2\text{SST} = \sum_{i=1}^{n} y_i^2 - n\bar{y}^2

此式在实际计算中更为便捷。SST 的量纲为因变量单位的平方,因此常与样本方差 sy2=SST/(n1)s_y^2 = \text{SST} / (n-1) 关联,后者是无偏总体方差估计量。

平方和分解定理

在含有截距项的线性回归模型 yi=β0+xiβ+ϵiy_i = \beta_0 + \mathbf{x}_i'\boldsymbol{\beta} + \epsilon_i 中,OLS 估计保证了如下正交分解成立:

SST=ESS+RSS\text{SST} = \text{ESS} + \text{RSS}

其中:

  • ESS=(y^iyˉ)2\text{ESS} = \sum (\hat{y}_i - \bar{y})^2回归平方和 (Explained Sum of Squares),度量由回归模型所解释的变异部分;
  • RSS=(yiy^i)2\text{RSS} = \sum (y_i - \hat{y}_i)^2残差平方和 (Residual Sum of Squares),度量模型未能解释的随机误差部分。

该分解的几何意义在于:因变量的总变异向量被正交投影到由解释变量张成的线性子空间及其正交补空间上,两者的平方长度恰为 ESS 与 RSS。这一正交性是 OLS 估计量具有 BLUE (最优线性无偏估计) 性质的重要基础。

与决定系数的关系

总平方和是构造 R2R^2 的基数:

R2=ESSSST=1RSSSSTR^2 = \frac{\text{ESS}}{\text{SST}} = 1 - \frac{\text{RSS}}{\text{SST}}

R2R^2 的经济含义是:回归模型能够解释的变异占因变量总变异的比例。当模型完全不解释任何变异时,ESS=0\text{ESS} = 0RSS=SST\text{RSS} = \text{SST},此时 R2=0R^2 = 0;当模型完美拟合所有观测点时,RSS=0\text{RSS} = 0ESS=SST\text{ESS} = \text{SST},此时 R2=1R^2 = 1

值得注意的是,SST 的大小受数据尺度的影响显著。例如,以元为单位计算的工资总平方和与以千元为单位计算的同一数据总平方和相差 10610^6 倍,但 R2R^2 是尺度不变的比例指标,不受此影响。

方差分析表

方差分析 (ANOVA) 中,SST 被分解为组间平方和 (SSB) 与组内平方和 (SSW):

SST=SSB+SSW\text{SST} = \text{SSB} + \text{SSW}

其中组间平方和反映各组均值之间的变异,组内平方和反映各组成员与组均值的变异。基于此分解构造的 F 统计量用于检验各组均值是否相等,其计算公式为:

F=SSB/(k1)SSW/(nk)=MSBMSWF = \frac{\text{SSB} / (k-1)}{\text{SSW} / (n-k)} = \frac{\text{MSB}}{\text{MSW}}

其中 kk 为组数,MSB 与 MSW 分别为组间和组内的均方。这一框架是单因素方差分析的核心。

在回归情境下,SST 的分解结果通常以 ANOVA 表格形式呈现,列出来源 (Source)、自由度 (df)、平方和 (SS)、均方 (MS) 和 F 统计量等栏目。该表为检验回归模型整体显著性提供了系统性信息。

性质与注意事项

第一,SST 总为非负实数,且仅当所有观测值完全相等时为零。第二,SST 对异常值 (outliers) 极为敏感——单个极端值可使 SST 大幅膨胀,进而压低 R2R^2 或扭曲 F 检验的结果。第三,SST 的定义依赖于样本均值 yˉ\bar{y},因此对于不含截距项的回归模型(即回归通过原点),平方和分解 SST = ESS + RSS 不再严格成立,此时 R2R^2 的计算应使用未中心化的总平方和 yi2\sum y_i^2。第四,在时间序列分析中若变量存在单位根 (unit root),SST 会随样本量增大而发散,导致传统 R2R^2 和 F 统计量的渐近分布偏离标准理论,需使用协整检验等专门方法处理。

返回百科索引