Sum of Squared Errors, SSE
Sum of Squared Errors (SSE,误差平方和),也称残差平方和 (Residual Sum of Squares, RSS),是回归分析 和方差分析 中最核心的拟合优度度量之一。SSE 度量模型预测值与实际观测值之间偏差的平方总和,其最小化正是普通最小二乘法 (OLS)的估计准则。
给定 n n n 个观测值 ( y i , x i ) (y_i, \mathbf{x}_i) ( y i , x i ) 和模型预测值 y ^ i \hat{y}_i y ^ i ,SSE 定义为:
S S E = ∑ i = 1 n ( y i − y ^ i ) 2 = ∑ i = 1 n e i 2 SSE = \sum_{i=1}^n (y_i - \hat{y}_i)^2 = \sum_{i=1}^n e_i^2 SSE = i = 1 ∑ n ( y i − y ^ i ) 2 = i = 1 ∑ n e i 2
其中 e i = y i − y ^ i e_i = y_i - \hat{y}_i e i = y i − y ^ i 为第 i i i 个残差 (residual),即观测值与模型拟合值之差。在经典线性回归模型 Y = X β + ε Y = X\boldsymbol{\beta} + \boldsymbol{\varepsilon} Y = X β + ε 下,OLS 估计量 β ^ \hat{\boldsymbol{\beta}} β ^ 正是通过最小化 SSE 求得:
β ^ = arg min β ∑ i = 1 n ( y i − x i T β ) 2 \hat{\boldsymbol{\beta}} = \underset{\boldsymbol{\beta}}{\arg\min} \sum_{i=1}^n (y_i - \mathbf{x}_i^T\boldsymbol{\beta})^2 β ^ = β arg min i = 1 ∑ n ( y i − x i T β ) 2
求导并令一阶条件为零,得正规方程 X T X β ^ = X T y X^TX\hat{\boldsymbol{\beta}} = X^T\mathbf{y} X T X β ^ = X T y ,解出 β ^ = ( X T X ) − 1 X T y \hat{\boldsymbol{\beta}} = (X^TX)^{-1}X^T\mathbf{y} β ^ = ( X T X ) − 1 X T y 。
平方和分解与决定系数
在线性回归含截距项的设定下,总平方和可作正交分解:
S S T = S S R + S S E SST = SSR + SSE SST = SSR + SSE
其中 S S T = ∑ ( y i − y ˉ ) 2 SST = \sum (y_i - \bar{y})^2 SST = ∑ ( y i − y ˉ ) 2 为总平方和 (Total Sum of Squares),S S R = ∑ ( y ^ i − y ˉ ) 2 SSR = \sum (\hat{y}_i - \bar{y})^2 SSR = ∑ ( y ^ i − y ˉ ) 2 为回归平方和 (Regression Sum of Squares)。这一分解是方差分析 (ANOVA)的理论基础。
基于此分解,决定系数 R 2 R^2 R 2 定义为回归平方和占总平方和的比例:
R 2 = S S R S S T = 1 − S S E S S T R^2 = \frac{SSR}{SST} = 1 - \frac{SSE}{SST} R 2 = SST SSR = 1 − SST SSE
R 2 ∈ [ 0 , 1 ] R^2 \in [0, 1] R 2 ∈ [ 0 , 1 ] 反映模型的解释力度:R 2 = 1 R^2 = 1 R 2 = 1 表示完美拟合(S S E = 0 SSE = 0 SSE = 0 ),R 2 = 0 R^2 = 0 R 2 = 0 表示模型并不优于用样本均值 y ˉ \bar{y} y ˉ 做预测。需注意,向模型添加更多解释变量总会使 SSE 减小(至少不增),因此 R 2 R^2 R 2 会机械上升。调整 R 2 R^2 R 2 (Adjusted R-squared )对新增变量数量施以惩罚:R ˉ 2 = 1 − S S E / ( n − p − 1 ) S S T / ( n − 1 ) \bar{R}^2 = 1 - \frac{SSE/(n-p-1)}{SST/(n-1)} R ˉ 2 = 1 − SST / ( n − 1 ) SSE / ( n − p − 1 ) 。
误差方差的估计
在高斯-马尔可夫定理 的经典假设下,误差项满足 Var ( ε i ) = σ 2 \operatorname{Var}(\varepsilon_i) = \sigma^2 Var ( ε i ) = σ 2 (同方差性 )且相互独立。SSE 提供了对 σ 2 \sigma^2 σ 2 的无偏估计:
σ ^ 2 = S S E n − p − 1 = M S E \hat{\sigma}^2 = \frac{SSE}{n - p - 1} = MSE σ ^ 2 = n − p − 1 SSE = MSE
其中 p p p 为解释变量个数(不含截距),分母 n − p − 1 n - p - 1 n − p − 1 是自由度 ——因估计 p + 1 p+1 p + 1 个参数消耗了等量的自由度。MSE(Mean Squared Error,均方误差 )是回归输出的标准组成部分,其平方根 σ ^ = M S E \hat{\sigma} = \sqrt{MSE} σ ^ = MSE 称为回归标准误 (Standard Error of the Regression),度量观测值在回归线周围的典型离散程度。
与大似然估计的联系
若进一步假设误差项服从正态分布 ε i ∼ N ( 0 , σ 2 ) \varepsilon_i \sim \mathcal{N}(0, \sigma^2) ε i ∼ N ( 0 , σ 2 ) ,则最大似然估计 (MLE)的对数似然函数为:
ℓ ( β , σ 2 ) = − n 2 ln ( 2 π σ 2 ) − 1 2 σ 2 ∑ i = 1 n ( y i − x i T β ) 2 \ell(\boldsymbol{\beta}, \sigma^2) = -\frac{n}{2}\ln(2\pi\sigma^2) - \frac{1}{2\sigma^2}\sum_{i=1}^n (y_i - \mathbf{x}_i^T\boldsymbol{\beta})^2 ℓ ( β , σ 2 ) = − 2 n ln ( 2 π σ 2 ) − 2 σ 2 1 i = 1 ∑ n ( y i − x i T β ) 2
在给定 σ 2 \sigma^2 σ 2 下最大化 ℓ \ell ℓ 等价于最小化 SSE——OLS 与 MLE 在此特殊情形下对 β \boldsymbol{\beta} β 的估计完全一致。换言之,正态误差假设下,最小化 SSE 得到的不再仅是BLUE (最佳线性无偏估计量),更是所有无偏估计量中方差最小的。
几何解释
SSE 在几何上表示为残差向量 e = y − y ^ \mathbf{e} = \mathbf{y} - \hat{\mathbf{y}} e = y − y ^ 的欧几里得长度的平方:S S E = ∥ e ∥ 2 = ∥ y − X β ^ ∥ 2 SSE = \|\mathbf{e}\|^2 = \|\mathbf{y} - X\hat{\boldsymbol{\beta}}\|^2 SSE = ∥ e ∥ 2 = ∥ y − X β ^ ∥ 2 。OLS 将 y \mathbf{y} y 投影到由设计矩阵 X X X 的列张成的子空间上,残差向量 e \mathbf{e} e 与该子空间正交。湮没矩阵 M = I − X ( X T X ) − 1 X T M = I - X(X^TX)^{-1}X^T M = I − X ( X T X ) − 1 X T 满足 e = M y \mathbf{e} = M\mathbf{y} e = M y ,从而 S S E = y T M y SSE = \mathbf{y}^T M \mathbf{y} SSE = y T M y 。
应用与相关概念
SSE 广泛应用于模型比较和选择。在嵌套模型 检验中,通过比较受约束与无约束模型的 SSE 差异构造 F 统计量:F = ( S S E R − S S E U ) / q S S E U / ( n − p − 1 ) F = \frac{(SSE_R - SSE_U)/q}{SSE_U/(n-p-1)} F = SS E U / ( n − p − 1 ) ( SS E R − SS E U ) / q ,其中 q q q 为约束条件个数。在模型选择准则 中,SSE 是AIC (Akaike Information Criterion)和BIC (Bayesian Information Criterion)的核心成分:A I C = n ln ( S S E / n ) + 2 k AIC = n\ln(SSE/n) + 2k A I C = n ln ( SSE / n ) + 2 k ,B I C = n ln ( S S E / n ) + k ln n BIC = n\ln(SSE/n) + k\ln n B I C = n ln ( SSE / n ) + k ln n 。在机器学习 中,MSE 是回归任务的标准损失函数 ,训练过程本质上即是最小化 SSE(或其均值形式)。在Chow检验 中,通过比较合并回归与分组回归的 SSE 大小判断是否存在结构性变化 。
SSE 作为拟合优度的基石性指标,贯穿从经典计量到现代机器学习的整个统计建模谱系——其最小化体现"数据拟合"这一最朴素也最基本的建模原则。