知经百科 / W

无偏估计量的定义与性质

无偏估计量 (Unbiased Estimator)

无偏估计量(Unbiased Estimator)是数理统计参数估计理论的一个核心概念。它指的是这样一种估计量:其期望值(或抽样分布的均值)恰好等于被估计的未知总体参数的真值。简而言之,一个无偏估计量在平均意义上是"准确"的,它既不会系统性地高估也不会系统性地低估真实的参数值。

定义

θ \theta 为一个需要被估计的未知总体参数(例如总体均值 μ \mu 或总体方差 σ2 \sigma^2 )。我们从该总体中抽取一个大小为 n n 随机样本 X1,X2,,Xn X_1, X_2, \ldots, X_n 。基于这个样本,我们构造一个函数 T(X1,X2,,Xn) T(X_1, X_2, \ldots, X_n) 来估计 θ \theta 。这个函数 T T 就被称为一个 估计量,通常记作 θ^ \hat{\theta}

如果一个估计量 θ^ \hat{\theta} 期望值 E(θ^) E(\hat{\theta}) 等于参数 θ \theta 的真值,那么我们就称 θ^ \hat{\theta} θ \theta 的一个 无偏估计量。数学上表示为:

E(θ^)=θE(\hat{\theta}) = \theta

这里的期望值 E() E(\cdot) 是在所有可能的样本构成的抽样分布上计算的。这个定义意味着,如果我们能够进行无数次重复抽样,并且每次都计算出一个估计值,那么所有这些估计值的平均数将无限接近于参数的真值 θ \theta

与此相对,如果 E(θ^)θ E(\hat{\theta}) \neq \theta ,则称 θ^ \hat{\theta} 是一个 有偏估计量(Biased Estimator)。其偏差(Bias)定义为:

Bias(θ^)=E(θ^)θ\text{Bias}(\hat{\theta}) = E(\hat{\theta}) - \theta

对于无偏估计量,其偏差为零。

直观理解:打靶喻例。无偏性可比作射手向靶心射击:无偏的射手虽散布在靶心周围,但所有弹着点的平均位置正好是靶心,单次射击可能偏左偏右,长期来看无系统性偏差。有偏的射手则弹着点平均位置系统性偏离靶心。此喻例清晰区分了单次估计的随机性与多次估计的长期平均趋势。

常见的无偏估计量示例

样本均值作为总体均值的估计量

最经典的无偏估计量是样本均值 Xˉ \bar{X} ,用它来估计总体均值 μ \mu

从均值为 μ \mu 、方差为 σ2 \sigma^2 的总体中抽取随机样本 X1,X2,,Xn X_1, X_2, \ldots, X_n 。样本均值定义为:

Xˉ=1ni=1nXi\bar{X} = \frac{1}{n} \sum_{i=1}^{n} X_i

利用期望值的线性性质可证 Xˉ \bar{X} μ \mu 的无偏估计量:

E(Xˉ)=E(1ni=1nXi)=1ni=1nE(Xi)=1ni=1nμ=1n(nμ)=μE(\bar{X}) = E\left(\frac{1}{n} \sum_{i=1}^{n} X_i\right) = \frac{1}{n} \sum_{i=1}^{n} E(X_i) = \frac{1}{n} \sum_{i=1}^{n} \mu = \frac{1}{n} (n\mu) = \mu

由于每个 Xi X_i 来自同一总体,E(Xi)=μ E(X_i) = \mu 对所有 i i 成立。因此 Xˉ \bar{X} μ \mu 的无偏估计量。

样本方差作为总体方差的估计量

估计总体方差 σ2 \sigma^2 的情况更为微妙。标准样本方差 S2 S^2 定义为:

S2=1n1i=1n(XiXˉ)2S^2 = \frac{1}{n-1} \sum_{i=1}^{n} (X_i - \bar{X})^2

分母为 n1 n-1 而非 n n ,这一修正确保 E(S2)=σ2 E(S^2) = \sigma^2 ,即 S2 S^2 σ2 \sigma^2 的无偏估计量。

为什么分母是 n1 n-1 此修正称为 贝塞尔校正(Bessel's Correction)。若使用 n n 作分母,令:

σ^n2=1ni=1n(XiXˉ)2\hat{\sigma}^2_n = \frac{1}{n} \sum_{i=1}^{n} (X_i - \bar{X})^2

其期望值为 E(σ^n2)=n1nσ2 E(\hat{\sigma}^2_n) = \frac{n-1}{n} \sigma^2 。由于 n1n<1 \frac{n-1}{n} < 1 σ^n2 \hat{\sigma}^2_n 系统性低估 σ2 \sigma^2 ,是一个有偏估计量。直观原因是:计算离差平方和时使用样本均值 Xˉ \bar{X} 而非总体均值 μ \mu ,数据围绕自身均值的离散程度天然小于围绕其他值的离散程度,引入向下偏差。使用 n1 n-1 (即样本的自由度)恰好校正此偏差。

无偏估计量的性质与评估标准

无偏性是评价估计量的重要但非唯一标准。好的估计量还需考虑以下性质:

1. 效率(Efficiency)。在所有对同一参数 θ \theta 的无偏估计量中,倾向选择方差最小者。方差越小,估计值的波动性越小,越稳定精确。无偏估计量中方差最小者称为 最小方差无偏估计量(Minimum Variance Unbiased Estimator, MVUE)。回到打靶比喻:两位射手均无偏,但弹着点集中者(低方差)更高效。例如,在正态总体下,样本均值 Xˉ \bar{X} 和样本中位数均可作为总体均值 μ \mu 的无偏估计,但 Xˉ \bar{X} 的方差为 σ2/n \sigma^2/n ,而中位数的方差约为 (π/2)(σ2/n) (\pi/2)(\sigma^2/n) ,大约是前者的 1.57 倍。因此 Xˉ \bar{X} 比中位数更高效,是 μ \mu 的 MVUE。

2. 均方误差(Mean Squared Error, MSE)。均方误差综合考虑偏差和方差,定义为:

MSE(θ^)=E[(θ^θ)2]\text{MSE}(\hat{\theta}) = E\left[(\hat{\theta} - \theta)^2\right]

MSE 可分解为方差与偏差平方之和:

MSE(θ^)=Var(θ^)+[Bias(θ^)]2\text{MSE}(\hat{\theta}) = \text{Var}(\hat{\theta}) + [\text{Bias}(\hat{\theta})]^2

对无偏估计量,Bias(θ^)=0 \text{Bias}(\hat{\theta}) = 0 ,MSE 等于方差。因此,在无偏估计量中寻找最优者等同于寻找方差最小者(MVUE)。然而,轻微有偏但方差极小的估计量,其 MSE 可能小于任何无偏估计量的 MSE,这引出统计学中的 偏差-方差权衡(Bias-Variance Tradeoff)。

3. 一致性(Consistency)。一致性(或相合性)描述大样本性质。若随着样本量 n n 增大,θ^n \hat{\theta}_n 依概率收敛于 θ \theta ,则称其为一致估计量。这意味着样本足够大时,有极大把握得到接近真值的估计。多数有用的无偏估计量(如 Xˉ \bar{X} )也是一致的,但"无偏"与"一致"是两个独立概念:估计量可以有偏但一致(如前述 σ^n2 \hat{\sigma}^2_n ),也可以无偏但不一致(虽较少见)。

寻找 MVUE 的理论工具

寻找最小方差无偏估计量是参数估计理论的重要目标。相关理论工具包括:

克拉美-罗下界(Cramér-Rao Lower Bound, CRLB):为所有无偏估计量的方差设定理论下限。若某无偏估计量的方差达到此下界,则可确认其为 MVUE。CRLB 通过费舍尔信息量(Fisher Information)计算,体现样本数据对参数的信息承载能力。

充分统计量(Sufficient Statistic)与 拉奥-布莱克威尔定理(Rao-Blackwell Theorem):若 T T 是参数的充分统计量,则任何无偏估计量可通过取条件期望 E(θ^T) E(\hat{\theta} \mid T) 改进(降低或保持方差),从而逐步逼近 MVUE。

莱曼-谢菲定理(Lehmann-Scheffé Theorem):若 T T 是完备充分统计量,且 θ^=g(T) \hat{\theta} = g(T) θ \theta 的无偏估计量,则 θ^ \hat{\theta} 是唯一的 MVUE。该定理提供了 MVUE 存在的充分条件。

无偏性与最大似然估计的关系

最大似然估计(Maximum Likelihood Estimation, MLE)是另一种广泛使用的参数估计方法。MLE 在大样本下具有一致性和渐近有效性,但在有限样本下可能是有偏的。典型例子如前述 σ^n2 \hat{\sigma}^2_n (除以 n n 的方差估计)正是正态总体下方差的 MLE,它是渐进无偏的(n n \to \infty 时偏差趋于零),但小样本下有偏。这体现了 MLE 的无偏性并非必然:MLE 优先最大化似然函数,而非保证无偏。然而,MLE 具有不变性(invariance):若 θ^ \hat{\theta} θ \theta 的 MLE,则对任意函数 g g g(θ^) g(\hat{\theta}) 也是 g(θ) g(\theta) 的 MLE——即使 g(θ^) g(\hat{\theta}) 可能是有偏的。相比之下,无偏性不具备函数变换下的不变性:E(θ^)=θ E(\hat{\theta}) = \theta 不意味着 E[g(θ^)]=g(θ) E[g(\hat{\theta})] = g(\theta) (除非 g g 是线性函数)。这一比较揭示了无偏性与 MLE 两种方法的不同侧重点与权衡。

总结

无偏估计量是统计推断的基石,为"平均"意义上不偏离真实目标的估计方法提供了数学基础。理解无偏性的核心在于区分单次估计的随机性与多次估计的长期平均趋势。样本均值 Xˉ \bar{X} 和经贝塞尔校正样本方差 S2 S^2 是最基础的无偏估计量范例。在评估和选择估计量时,除无偏性外,必须综合考虑效率(方差)、均方误差一致性。寻找最小方差无偏估计量(MVUE)是参数估计理论的核心目标,克拉美-罗下界充分统计量拉奥-布莱克威尔定理为这一目标提供了理论支撑。在实际统计建模中,无偏性常需与最大似然估计贝叶斯估计等方法配合使用,根据具体问题在偏差、方差和计算可行性之间做出最优权衡。

返回百科索引