知经百科 / S

Sum of Squared Errors, SSE

Sum of Squared Errors, SSE

Sum of Squared Errors(SSE,误差平方和),也称残差平方和(Residual Sum of Squares, RSS),是回归分析方差分析中最核心的拟合优度度量之一。SSE 度量模型预测值与实际观测值之间偏差的平方总和,其最小化正是普通最小二乘法(OLS)的估计准则。

给定 nn 个观测值 (yi,xi)(y_i, \mathbf{x}_i) 和模型预测值 y^i\hat{y}_i,SSE 定义为:

SSE=i=1n(yiy^i)2=i=1nei2SSE = \sum_{i=1}^n (y_i - \hat{y}_i)^2 = \sum_{i=1}^n e_i^2

其中 ei=yiy^ie_i = y_i - \hat{y}_i 为第 ii残差(residual),即观测值与模型拟合值之差。在经典线性回归模型 Y=Xβ+εY = X\boldsymbol{\beta} + \boldsymbol{\varepsilon} 下,OLS 估计量 β^\hat{\boldsymbol{\beta}} 正是通过最小化 SSE 求得:

β^=argminβi=1n(yixiTβ)2\hat{\boldsymbol{\beta}} = \underset{\boldsymbol{\beta}}{\arg\min} \sum_{i=1}^n (y_i - \mathbf{x}_i^T\boldsymbol{\beta})^2

求导并令一阶条件为零,得正规方程 XTXβ^=XTyX^TX\hat{\boldsymbol{\beta}} = X^T\mathbf{y},解出 β^=(XTX)1XTy\hat{\boldsymbol{\beta}} = (X^TX)^{-1}X^T\mathbf{y}

平方和分解与决定系数

在线性回归含截距项的设定下,总平方和可作正交分解:

SST=SSR+SSESST = SSR + SSE

其中 SST=(yiyˉ)2SST = \sum (y_i - \bar{y})^2总平方和(Total Sum of Squares),SSR=(y^iyˉ)2SSR = \sum (\hat{y}_i - \bar{y})^2回归平方和(Regression Sum of Squares)。这一分解是方差分析(ANOVA)的理论基础。

基于此分解,决定系数 R2R^2 定义为回归平方和占总平方和的比例:

R2=SSRSST=1SSESSTR^2 = \frac{SSR}{SST} = 1 - \frac{SSE}{SST}

R2[0,1]R^2 \in [0, 1] 反映模型的解释力度:R2=1R^2 = 1 表示完美拟合(SSE=0SSE = 0),R2=0R^2 = 0 表示模型并不优于用样本均值 yˉ\bar{y} 做预测。需注意,向模型添加更多解释变量总会使 SSE 减小(至少不增),因此 R2R^2 会机械上升。调整 R2R^2Adjusted R-squared)对新增变量数量施以惩罚:Rˉ2=1SSE/(np1)SST/(n1)\bar{R}^2 = 1 - \frac{SSE/(n-p-1)}{SST/(n-1)}

误差方差的估计

高斯-马尔可夫定理的经典假设下,误差项满足 Var(εi)=σ2\operatorname{Var}(\varepsilon_i) = \sigma^2同方差性)且相互独立。SSE 提供了对 σ2\sigma^2 的无偏估计:

σ^2=SSEnp1=MSE\hat{\sigma}^2 = \frac{SSE}{n - p - 1} = MSE

其中 pp 为解释变量个数(不含截距),分母 np1n - p - 1自由度——因估计 p+1p+1 个参数消耗了等量的自由度。MSE(Mean Squared Error,均方误差)是回归输出的标准组成部分,其平方根 σ^=MSE\hat{\sigma} = \sqrt{MSE} 称为回归标准误(Standard Error of the Regression),度量观测值在回归线周围的典型离散程度。

与大似然估计的联系

若进一步假设误差项服从正态分布 εiN(0,σ2)\varepsilon_i \sim \mathcal{N}(0, \sigma^2),则最大似然估计(MLE)的对数似然函数为:

(β,σ2)=n2ln(2πσ2)12σ2i=1n(yixiTβ)2\ell(\boldsymbol{\beta}, \sigma^2) = -\frac{n}{2}\ln(2\pi\sigma^2) - \frac{1}{2\sigma^2}\sum_{i=1}^n (y_i - \mathbf{x}_i^T\boldsymbol{\beta})^2

在给定 σ2\sigma^2 下最大化 \ell 等价于最小化 SSE——OLS 与 MLE 在此特殊情形下对 β\boldsymbol{\beta} 的估计完全一致。换言之,正态误差假设下,最小化 SSE 得到的不再仅是BLUE(最佳线性无偏估计量),更是所有无偏估计量中方差最小的。

几何解释

SSE 在几何上表示为残差向量 e=yy^\mathbf{e} = \mathbf{y} - \hat{\mathbf{y}} 的欧几里得长度的平方:SSE=e2=yXβ^2SSE = \|\mathbf{e}\|^2 = \|\mathbf{y} - X\hat{\boldsymbol{\beta}}\|^2。OLS 将 y\mathbf{y} 投影到由设计矩阵 XX 的列张成的子空间上,残差向量 e\mathbf{e} 与该子空间正交。湮没矩阵 M=IX(XTX)1XTM = I - X(X^TX)^{-1}X^T 满足 e=My\mathbf{e} = M\mathbf{y},从而 SSE=yTMySSE = \mathbf{y}^T M \mathbf{y}

应用与相关概念

SSE 广泛应用于模型比较和选择。在嵌套模型检验中,通过比较受约束与无约束模型的 SSE 差异构造 F 统计量:F=(SSERSSEU)/qSSEU/(np1)F = \frac{(SSE_R - SSE_U)/q}{SSE_U/(n-p-1)},其中 qq 为约束条件个数。在模型选择准则中,SSE 是AIC(Akaike Information Criterion)和BIC(Bayesian Information Criterion)的核心成分:AIC=nln(SSE/n)+2kAIC = n\ln(SSE/n) + 2kBIC=nln(SSE/n)+klnnBIC = n\ln(SSE/n) + k\ln n。在机器学习中,MSE 是回归任务的标准损失函数,训练过程本质上即是最小化 SSE(或其均值形式)。在Chow检验中,通过比较合并回归与分组回归的 SSE 大小判断是否存在结构性变化

SSE 作为拟合优度的基石性指标,贯穿从经典计量到现代机器学习的整个统计建模谱系——其最小化体现"数据拟合"这一最朴素也最基本的建模原则。

返回百科索引