知经百科 / Y

有放回抽样

有放回抽样(Sampling with Replacement)是指在从有限总体中抽取样本时,每次随机抽取一个单位后将其放回总体,使得同一单位有可能被多次抽中的抽样方法。与之相对的是不放回抽样(Sampling without Replacement),后者一旦某个单位被抽出便不再放回,每个单位至多出现一次。有放回抽样的核心特征在于每次抽取都是独立的——总体构成在每次抽取前保持不变,因此每次抽取的结果不依赖于此前的结果。这一独立性使得有放回抽样在概率论和数理统计的理论推导中占据基础地位,它直接对应独立同分布(i.i.d.)假设,是大多数经典统计推断方法得以成立的逻辑起点。

1. 基本性质与数学刻画

有放回抽样的数学基础是多项分布二项分布。设总体容量为 NN,其中具有某特征的单位数为 MM,特征比例为 p=M/Np = M/N。从中有放回地抽取 nn 次,每次抽到具有该特征单位的概率恒为 pp,因此抽中次数 XX 服从二项分布:

XBinomial(n,p),P(X=k)=(nk)pk(1p)nkX \sim \text{Binomial}(n, p), \quad P(X=k) = \binom{n}{k} p^k (1-p)^{n-k}

其期望和方差分别为:

E[X]=np,Var(X)=np(1p)\mathbb{E}[X] = np, \quad \text{Var}(X) = np(1-p)

对于总体均值 μ\mu 和方差 σ2\sigma^2,有放回抽样下样本均值 Xˉ\bar{X} 的期望和方差为:

E[Xˉ]=μ,Var(Xˉ)=σ2n\mathbb{E}[\bar{X}] = \mu, \quad \text{Var}(\bar{X}) = \frac{\sigma^2}{n}

无偏性:样本均值是总体均值的无偏估计,这一性质在有放回抽样下直接由独立同分布假设保证。标准误σ/n\sigma / \sqrt{n},其中 σ\sigma 为总体标准差。大数定律保证当 nn 充分大时样本均值以概率收敛于总体均值,而中心极限定理则确保样本均值的分布近似正态分布,为构建置信区间和假设检验提供了理论依据。

2. 有放回抽样与不放回抽样的对比

有限总体修正因子(Finite Population Correction, FPC)是联系两种抽样方式的核心概念。不放回抽样下,样本均值的方差需乘以修正因子 (Nn)/(N1)(N-n)/(N-1)

Var不放回(Xˉ)=σ2nNnN1\text{Var}_{\text{不放回}}(\bar{X}) = \frac{\sigma^2}{n} \cdot \frac{N-n}{N-1}

有放回抽样的方差则可视为令 (Nn)/(N1)1(N-n)/(N-1) \approx 1 的特例。当抽样比 n/Nn/N 很小时,两种抽样的方差差异微乎其微——这正是实际调查中即便采用不放回抽样也常按有放回公式近似计算的原因。然而,当抽样比较高时(如 n/N>0.1n/N > 0.1),忽略FPC会显著高估标准误,导致置信区间过宽、检验功效降低。

从信息效率的角度看,不放回抽样由于避免了重复观测,在相同样本量下通常具有更小的方差,因而更为高效。但这一效率优势并非没有代价:不放回抽样的观测值之间存在负相关性,这使得数理处理更为复杂。相比之下,有放回抽样的独立性极大地简化了统计量的分布推导,许多经典结论(如Cramér-Rao下界、Fisher信息量的可加性)都直接以独立同分布为前提。

3. Bootstrap方法:有放回抽样的现代应用

有放回抽样的最著名现代应用当属Bootstrap方法(由Bradley Efron于1979年提出)。Bootstrap的核心思想是将观测样本视为"经验总体",通过有放回地从中反复重采样来估计统计量的抽样分布。其基本原理如下:给定容量为 nn 的观测样本 {x1,x2,,xn}\{x_1, x_2, \dots, x_n\},从中有放回地抽取 BB 个大小为 nn 的重采样样本(每个重采样样本中某些原始观测可能多次出现,某些则完全缺失),对每个重采样样本计算目标统计量,从而获得该统计量的经验分布。

Bootstrap方法的优越性在于其非参数性质——它无需对总体分布做任何参数假定,仅依赖有放回抽样机制来近似统计量的真实抽样分布。这使得Bootstrap在以下场景中尤为有用:统计量的方差没有解析形式(如中位数、相关系数)、小样本下渐近近似失效、以及复杂模型中的标准误估计等。常见的Bootstrap变体包括百分位BootstrapBCa校正Bootstrap(偏差校正加速法)和Bootstrap-t方法,它们在不同偏态和偏差程度下各有优劣。

值得注意的是,Bootstrap方法的有效性依赖于重采样过程与原始抽样过程的匹配——若原始数据来自有放回抽样,则Bootstrap直接适用;若原始数据来自不放回抽样(如大多数调查数据),则需使用"无放回Bootstrap"或刀切法(Jackknife)等进行调整。

4. 实际应用中的考量

有放回抽样在实际调查中的应用场景虽不及不放回抽样普遍,但在以下情形中仍具有独特价值:其一,当总体十分庞大而抽样比极低时(如全国性电话调查),有放回与不放回的实际差异可忽略不计;其二,在计算机模拟和蒙特卡洛方法中,有放回抽样(即随机数生成)是实现独立同分布模拟的基本操作;其三,在质量控制中的连续抽样方案中,有放回机制保障了过程的平稳性。

然而,有放回抽样也面临明显的实践局限。由于存在重复观测,相同样本量下其信息量低于不放回抽样。此外,在总体单位物理上无法重复获取的场合(如破坏性测试——检测灯泡寿命后灯泡已损坏),有放回抽样自然无法实施。因此,抽样实践中的标准建议是:在条件允许时应优先采用不放回抽样以获取更高的估计精度,而在小抽样比或需要依赖独立性假设进行理论推导时,有放回抽样或其近似则是合理且便利的选择。理解有放回抽样与不放回抽样的本质差异,是正确选择抽样方案和准确进行统计推断的前提。

参考文献

  • Efron, B., \& Tibshirani, R. J. (1993). An Introduction to the Bootstrap. Chapman \& Hall.
  • Cochran, W. G. (1977). Sampling Techniques (3rd ed.). John Wiley \& Sons.
  • Lohr, S. L. (2019). Sampling: Design and Analysis (2nd ed.). CRC Press.
  • 金勇进. (2015). 《抽样技术》. 中国人民大学出版社.

返回百科索引