知经百科 / Y

有偏样本方差

有偏样本方差 (Biased Sample Variance)

有偏样本方差是指以分母 nn(样本容量)而非 n1n-1 构造的方差估计量:

σ^2=1ni=1n(XiXˉ)2\hat{\sigma}^2 = \frac{1}{n} \sum_{i=1}^{n} (X_i - \bar{X})^2

其中 Xˉ=1ni=1nXi\bar{X} = \frac{1}{n}\sum_{i=1}^{n} X_i 为样本均值。该估计量是总体方差 σ2\sigma^2极大似然估计(在正态假设下),但由于其期望不等于真值,被称为"有偏"。与之相对的是无偏样本方差 s2=1n1i=1n(XiXˉ)2s^2 = \frac{1}{n-1} \sum_{i=1}^{n} (X_i - \bar{X})^2,后者以 n1n-1 为分母以消除偏差。二者仅相差一个尺度因子:σ^2=n1ns2\hat{\sigma}^2 = \frac{n-1}{n} s^2

偏差的来源与数学证明

X1,X2,,XnX_1, X_2, \ldots, X_n 为独立同分布样本,总体均值 μ=E[Xi]\mu = \mathbb{E}[X_i],总体方差 σ2=Var(Xi)\sigma^2 = \mathrm{Var}(X_i)。将离差平方和展开:

i=1n(XiXˉ)2=i=1n(Xiμ)2n(Xˉμ)2\sum_{i=1}^{n} (X_i - \bar{X})^2 = \sum_{i=1}^{n} (X_i - \mu)^2 - n(\bar{X} - \mu)^2

取期望。第一项 E[(Xiμ)2]=nσ2\mathbb{E}\left[\sum (X_i - \mu)^2\right] = n\sigma^2。第二项中 E[(Xˉμ)2]=Var(Xˉ)=σ2n\mathbb{E}[(\bar{X} - \mu)^2] = \mathrm{Var}(\bar{X}) = \frac{\sigma^2}{n},故 E[n(Xˉμ)2]=σ2\mathbb{E}[n(\bar{X} - \mu)^2] = \sigma^2。代入得:

E[i=1n(XiXˉ)2]=nσ2σ2=(n1)σ2\mathbb{E}\left[\sum_{i=1}^{n} (X_i - \bar{X})^2\right] = n\sigma^2 - \sigma^2 = (n-1)\sigma^2

因此:

E[σ^2]=n1nσ2=σ2σ2n\mathbb{E}[\hat{\sigma}^2] = \frac{n-1}{n}\sigma^2 = \sigma^2 - \frac{\sigma^2}{n}

偏差 Bias(σ^2)=E[σ^2]σ2=σ2n\mathrm{Bias}(\hat{\sigma}^2) = \mathbb{E}[\hat{\sigma}^2] - \sigma^2 = -\frac{\sigma^2}{n},方向为系统性低估。偏差量随样本量增大而衰减(O(1/n)O(1/n)),在小样本中尤为显著。这正是引入贝塞尔校正(Bessel's correction)——将分母从 nn 替换为 n1n-1——的原因。

直观上,偏差的根源在于 Xˉ\bar{X} 本身就是从同一样本估计得到的。样本均值天然比任何一个数据点更靠近数据中心,因此以 Xˉ\bar{X} 为基准计算的离散程度必然小于以真值 μ\mu 为基准的计算结果。用去了一个自由度来估计均值,剩余有效的独立离差信息只有 n1n-1 个。

与无偏估计量的比较:均方误差视角

尽管有偏样本方差在期望意义上偏离真值,但无偏性并非评价估计量的唯一标准。考虑均方误差(MSE):

MSE(θ^)=E[(θ^θ)2]=Var(θ^)+[Bias(θ^)]2\mathrm{MSE}(\hat{\theta}) = \mathbb{E}[(\hat{\theta} - \theta)^2] = \mathrm{Var}(\hat{\theta}) + [\mathrm{Bias}(\hat{\theta})]^2

假设总体服从正态分布 N(μ,σ2)N(\mu, \sigma^2)。此时 (XiXˉ)2/σ2χn12\sum (X_i - \bar{X})^2 / \sigma^2 \sim \chi^2_{n-1}(自由度为 n1n-1卡方分布)。由此可得:

Var(σ^2)=(n1n)22σ4n1=2(n1)σ4n2\mathrm{Var}(\hat{\sigma}^2) = \left(\frac{n-1}{n}\right)^2 \cdot \frac{2\sigma^4}{n-1} = \frac{2(n-1)\sigma^4}{n^2}
MSE(σ^2)=2(n1)σ4n2+(σ2n)2=2n1n2σ4\mathrm{MSE}(\hat{\sigma}^2) = \frac{2(n-1)\sigma^4}{n^2} + \left(-\frac{\sigma^2}{n}\right)^2 = \frac{2n-1}{n^2}\sigma^4

对于无偏估计量 s2s^2

Var(s2)=2σ4n1,MSE(s2)=2σ4n1\mathrm{Var}(s^2) = \frac{2\sigma^4}{n-1}, \quad \mathrm{MSE}(s^2) = \frac{2\sigma^4}{n-1}

比较两者 MSE 的比值:

MSE(σ^2)MSE(s2)=(2n1)(n1)n22=2n23n+12n2=132n+12n2<1\frac{\mathrm{MSE}(\hat{\sigma}^2)}{\mathrm{MSE}(s^2)} = \frac{(2n-1)(n-1)}{n^2 \cdot 2} = \frac{2n^2 - 3n + 1}{2n^2} = 1 - \frac{3}{2n} + \frac{1}{2n^2} < 1

这一不等式对任意 n2n \geq 2 成立。也就是说,有偏样本方差的均方误差严格小于无偏样本方差。原因在于,虽然 σ^2\hat{\sigma}^2 引入了偏差,但其方差以更快的速度缩小(乘以了 (n1)2/n2(n-1)^2/n^2),综合效果是 MSE 更优。从这个角度看,以 MSE 为损失函数时,nn 分母的估计量反而是"更好"的。选择 nn 还是 n1n-1 实质上取决于研究目的:若追求无偏(如线性回归中方差分量的假设检验),用 n1n-1;若追求预测精度与决策论最优,nn 分母(或更一般的收缩估计量)可能更优。

与极大似然估计的联系

在正态总体 N(μ,σ2)N(\mu, \sigma^2) 的假设下,对数似然函数为:

(μ,σ2)=n2log(2π)n2logσ212σ2i=1n(Xiμ)2\ell(\mu, \sigma^2) = -\frac{n}{2}\log(2\pi) - \frac{n}{2}\log\sigma^2 - \frac{1}{2\sigma^2}\sum_{i=1}^{n} (X_i - \mu)^2

分别对 μ\muσ2\sigma^2 求偏导并置零,得:

μ^MLE=Xˉ,σ^MLE2=1ni=1n(XiXˉ)2\hat{\mu}_{\text{MLE}} = \bar{X}, \quad \hat{\sigma}^2_{\text{MLE}} = \frac{1}{n}\sum_{i=1}^{n} (X_i - \bar{X})^2

MLE 给出的恰是有偏样本方差。这不是偶然——极大似然估计在大样本下具备一致性、渐近正态性与渐近有效性,但在有限样本下不必无偏。若改为限制极大似然(REML,Restricted Maximum Likelihood),则可得到无偏估计量 s2s^2。REML 的核心理念是先通过线性变换消除固定效应(此处为 μ\mu),在残差空间上构作似然,从而使方差分量的估计自动校正自由度损失。

渐近性质与一致性

尽管有偏,σ^2\hat{\sigma}^2σ2\sigma^2一致估计量:当 nn \to \infty 时,σ^2pσ2\hat{\sigma}^2 \xrightarrow{p} \sigma^2。这来自大数定律——1n(XiXˉ)2\frac{1}{n}\sum (X_i - \bar{X})^2 依概率收敛到 E[(Xμ)2]=σ2\mathbb{E}[(X - \mu)^2] = \sigma^2,而 Xˉpμ\bar{X} \xrightarrow{p} \mu 保证了以样本均值为中心的离差平方和渐近等价于以总体均值为中心的离差平方和。同时,n/(n1)n/(n-1) 因子趋近于 1,使得有偏与无偏估计量在样本量充足时几乎不可区分。实践中,当 n>100n > 100 时,二者的数值差异已可忽略。

多维推广:有偏样本协方差矩阵

上述讨论自然延伸到多变量情形。对于 pp 维随机向量 XX有偏样本协方差矩阵定义为:

Σ^=1ni=1n(XiXˉ)(XiXˉ)\hat{\Sigma} = \frac{1}{n} \sum_{i=1}^{n} (X_i - \bar{X})(X_i - \bar{X})^\top

其期望 E[Σ^]=n1nΣ\mathbb{E}[\hat{\Sigma}] = \frac{n-1}{n}\Sigma,同样系统性低估真协方差矩阵 Σ\Sigma。无偏版本 S=1n1(XiXˉ)(XiXˉ)S = \frac{1}{n-1} \sum (X_i - \bar{X})(X_i - \bar{X})^\top 则满足 E[S]=Σ\mathbb{E}[S] = \Sigma。在多变量分析中,这种偏差可能传导至主成分分析的特征值估计、线性判别分析的协方差矩阵逆等下游任务,需要在精度矩阵(precision matrix)估计或高维协方差正则化中仔细权衡。

与其他概念的关系

有偏样本方差与以下概念密切相关:

  • 贝塞尔校正:以 n1n-1 替代 nn 的无偏化处理,核心在于弥补估计均值所消耗的一个自由度。该校正可推广到一般线性模型——残差方差的无偏估计量为残差平方和除以其自由度,而非样本量。
  • 自由度:有偏估计量使用 nn 个名义样本点,但数据中独立的信息量为 n1n-1(因一个线性约束 (XiXˉ)=0\sum (X_i - \bar{X}) = 0)。自由度的概念贯穿统计推断全领域。
  • 收缩估计量:James-Stein 估计量等表明,适当引入偏差可大幅降低 MSE。有偏样本方差可以看作一种简单形式的收缩——将无偏估计量向零收缩一个因子 (n1)/n(n-1)/n。更一般的方差收缩估计量(如以先验信息引导的贝叶斯估计)可进一步改善 MSE。
  • 标准误t统计量:在实际假设检验中,若分母使用有偏样本方差,所得 t 统计量的分布需重新推导,否则可能导致拒绝域偏离名义水平。标准统计软件(如 R 的 \texttt{var()} 函数)默认采用无偏估计量,正是为了保证后续推断的标准性。

总结

有偏样本方差以 nn 为分母,其期望值为 n1nσ2\frac{n-1}{n}\sigma^2,系统性低估总体方差。贝塞尔校正(除以 n1n-1)消除该偏差,使估计量在重复抽样意义上准确。然而,无偏性并非估计量的绝对美德——有偏样本方差在均方误差意义上反而优于无偏版本,且是正态模型下的极大似然估计量。实践中,n1n-1 分母因其无偏性以及与传统推断框架(t 检验、ANOVA、线性回归)的无缝衔接而成为默认选择,但理解"有偏"版本的本质与性质,有助于更深刻地把握估计理论中偏差-方差权衡这一核心议题。

返回百科索引