知经百科 / Y

有限样本分布

有限样本分布 (Finite Sample Distribution)

有限样本分布 (Finite Sample Distribution),也称精确分布 (Exact Distribution) 或小样本分布 (Small-Sample Distribution),是数理统计学中的一个核心概念。它指的是在样本容量 nn 固定且有限的条件下,某个统计量估计量的精确概率分布。与渐近分布不同,有限样本分布不做 nn \to \infty 的极限逼近,而是刻画统计量在现实的、有限的样本条件下的真实行为。这一概念构成了精确推断 (Exact Inference) 的理论基础——在不依赖大样本近似的前提下,构造具有精确置信水平的置信区间和具有精确检验水准的假设检验。

有限样本分布与渐近分布

为了理解有限样本分布的独特价值,有必要将其与渐近分布加以对照。渐近分布回答的问题是:「当样本量趋于无穷时,统计量的分布趋近于什么?」典型结论包括中心极限定理——标准化样本均值依分布收敛于标准正态,以及Delta方法——可微变换下的渐近正态性。这些结论具有普适性,几乎不依赖于总体分布的具体形式,因而应用极广。然而渐近理论存在一个本质局限:它不回答「在给定的、有限的 nn 下,近似误差有多大」这一问题。

有限样本分布则直面该问题。它精确地给出统计量在每一个具体 nn 下的分布函数或概率密度函数,不涉及任何极限操作。以正态总体下样本均值的分布为例:设 X1,,Xni.i.d.N(μ,σ2)X_1, \dots, X_n \stackrel{\text{i.i.d.}}{\sim} \mathcal{N}(\mu, \sigma^2),则样本均值 Xˉn\bar{X}_n 的有限样本分布为:

XˉnN ⁣(μ,σ2n)\bar{X}_n \sim \mathcal{N}\!\left(\mu, \frac{\sigma^2}{n}\right)

这一结论对任意 n1n \geq 1 均精确成立,而非近似。当 σ2\sigma^2 未知时,t-统计量

T=XˉnμSn/nT = \frac{\bar{X}_n - \mu}{S_n / \sqrt{n}}

的有限样本分布为自由度为 n1n-1t分布——这同样是精确结果,不依赖于 nn 的大小。

但有限样本分布的推导通常要求较强的分布假设(如上例中的正态性)。一旦离开正态总体,样本均值的有限样本分布便不复有简洁的闭式解,此时渐近正态性就成为不可或缺的替代工具。因此,有限样本理论与渐近理论并非对立,而是互补:前者在强假设下提供精确性,后者在弱假设下提供普适性。

经典例子

统计学中有若干著名的有限样本分布结果,它们构成了经典推断方法的理论支柱。

正态样本下的三大抽样分布。X1,,Xni.i.d.N(μ,σ2)X_1, \dots, X_n \stackrel{\text{i.i.d.}}{\sim} \mathcal{N}(\mu, \sigma^2),样本方差 S2=1n1i=1n(XiXˉ)2S^2 = \frac{1}{n-1}\sum_{i=1}^n (X_i - \bar{X})^2。则以下三个枢轴量具有精确的有限样本分布:

  1. (n1)S2σ2χ2(n1)\frac{(n-1)S^2}{\sigma^2} \sim \chi^2(n-1),即自由度为 n1n-1卡方分布。该结论对任意 n2n \geq 2 精确成立,是正态总体方差推断的基石。
  2. XˉμS/nt(n1)\frac{\bar{X} - \mu}{S / \sqrt{n}} \sim t(n-1)。无论 nn 多小,只要总体服从正态分布,该 t-统计量便精确服从 t 分布而非近似服从标准正态。当 nn \to \infty 时,t 分布收敛于标准正态,这意味着大样本下精确分布与渐近分布趋于一致。
  3. 两个独立正态样本的方差比服从F分布S12/σ12S22/σ22F(n11,n21)\frac{S_1^2 / \sigma_1^2}{S_2^2 / \sigma_2^2} \sim F(n_1-1, n_2-1)

均匀分布下的次序统计量。X1,,Xni.i.d.U(0,θ)X_1, \dots, X_n \stackrel{\text{i.i.d.}}{\sim} \mathcal{U}(0, \theta),则最大次序统计量 X(n)X_{(n)} 的有限样本分布为:

fX(n)(x)=nxn1θn,0<x<θf_{X_{(n)}}(x) = \frac{n x^{n-1}}{\theta^n}, \quad 0 < x < \theta

由此可直接构造 θ\theta 的精确置信区间。

二项分布下的样本比例。nn 次独立伯努利试验中成功次数 KBinomial(n,p)K \sim \mathrm{Binomial}(n, p),这正是样本比例 p^=K/n\hat{p} = K/n 的有限样本分布——对任意 nn 精确成立,无需任何连续性近似。

精确推断与枢轴量方法

有限样本分布的最重要应用在于精确推断。构造精确置信区间和精确检验的标准工具是枢轴量 (Pivotal Quantity)——一个依赖样本和未知参数、但其分布完全已知且不依赖任何未知参数的函数。

枢轴量方法的逻辑链条如下:设待推断参数为 θ\theta,寻找到一个函数 Q(X,θ)Q(\mathbf{X}, \theta),使得 QQ 的有限样本分布是已知的(如标准正态、t 分布、卡方分布等),且不依赖于 θ\theta 或任何多余参数。则对给定的置信水平 1α1-\alpha,可找到常数 a,ba, b 使得:

Pθ(aQ(X,θ)b)=1αP_\theta(a \leq Q(\mathbf{X}, \theta) \leq b) = 1 - \alpha

将该不等式关于 θ\theta「反解」,即得 θ\theta 的置信区间。此区间的覆盖概率对任意 nn 均精确等于 1α1-\alpha,而非近似。

例如,正态总体均值的 tt 置信区间:

Xˉ±tn1,α/2Sn\bar{X} \pm t_{n-1, \alpha/2} \cdot \frac{S}{\sqrt{n}}

在正态性假设下,这一区间的覆盖概率对任意 nn 精确为 1α1-\alpha。相比之下,基于渐近正态性的 Wald 区间 Xˉ±zα/2S/n\bar{X} \pm z_{\alpha/2} \cdot S / \sqrt{n} 仅在 nn 充分大时才能保证覆盖概率接近名义水平。

有限样本性质与估计量评价

有限样本分布还直接关联估计量的有限样本性质评价。无偏性 (Unbiasedness) 是一个典型的有限样本概念:E[θ^n]=θ\mathbb{E}[\hat{\theta}_n] = \theta 对任意 nn 成立,其中期望是对 θ^n\hat{\theta}_n 的有限样本分布取的。类似地,均方误差 (MSE) 的分解 MSE(θ^n)=Var(θ^n)+[Bias(θ^n)]2\mathrm{MSE}(\hat{\theta}_n) = \operatorname{Var}(\hat{\theta}_n) + [\mathrm{Bias}(\hat{\theta}_n)]^2 同样是基于有限样本分布的概念,方差和偏倚都恰是有限样本分布的前两阶矩。

相比之下,一致性严格来说是渐近性质(nn \to \inftyθ^npθ\hat{\theta}_n \stackrel{p}{\to} \theta),尽管实际中常谨慎地表述为「在合理样本量下估计量应接近真值」。而渐近有效性则以渐近方差是否达到Cramér-Rao下界为判据。一个估计量可能具有一致性却在小样本下表现糟糕——例如 IV 估计量在弱工具变量情况下,即使一致性成立,有限样本分布也可能严重偏离正态、偏倚巨大。这正是有限样本分析不可替代的原因。

小样本理论与高阶渐近

除精确有限样本分布外,统计学家还发展了一套高阶渐近理论来弥合有限样本与一阶渐近之间的鸿沟。经典工具包括:

  • Edgeworth 展开:将统计量分布函数展开为 n1/2,n1,n3/2,n^{-1/2}, n^{-1}, n^{-3/2}, \dots 的渐进级数,每一项以标准正态密度和累积量表达。一阶展开恢复中心极限定理;纳入高阶项可更准确地逼近有限样本分布,尤其对分布的尾部行为有重要修正。
  • Saddlepoint 逼近:通过累积量生成函数的 Legendre 变换获得比 Edgeworth 展开在尾部区域更为精确的密度近似,在极值区域往往优于正态近似数个数量级。
  • Bootstrap校准:Efron 提出的 Bootstrap 方法通过对经验分布的重抽样来模拟有限样本分布,而 Bootstrap-t 或 BCa 等校准技术可进一步将覆盖误差从 O(n1/2)O(n^{-1/2}) 降至 O(n1)O(n^{-1}),使之达到二阶精度。

这些方法雖不以闭式精确分布为目标,但提供了比简单正态近似远为精确的有限样本推断工具。

与相关概念的联系

有限样本分布与多个核心统计概念紧密相连。充分性:由Fisher-Neyman因子分解定理,充分统计量浓缩了样本中关于参数的全部信息,而基于充分统计量构造的枢轴量往往具有更简洁的有限样本分布。似然比检验:在正则条件下,2logλ-2\log\lambda 的渐近分布为卡方分布,但在某些特殊情形(如正态线性模型)下,该统计量具有精确的 F 分布——这正是有限样本分析优于渐近分析的明证。Behrens-Fisher问题:两正态总体均值差在方差不等且未知时的精确推断至今仍是有限样本理论中的经典难题,不存在基于有限样本分布的精确枢轴量,各种近似解法的优劣比较始终是统计方法研究的活跃领域。Berry-Esseen不等式则从反向视角量化了有限样本分布偏离渐近分布的程度,为「nn 需要多大才能放心使用正态近似」提供理论指导。

有限样本分布理论提醒我们:统计推断的质量不仅取决于方法的渐近合法性,更取决于它在一个具体的、不可变的样本量下的真实表现。在计量经济学、生物统计学和临床试验设计中,这一意识的缺失是诸多不可重复性危机的隐性根源之一。

返回百科索引