知经百科 / S

随机样本 (random sample)

随机样本 (Random Sample)

随机样本统计学计量经济学中最基础的概念之一,指通过随机化机制从目标总体中选取的一部分个体或观测值。随机抽样的核心目标在于确保样本对总体具有代表性,从而允许研究者基于样本数据对总体特征进行统计推断

定义

从数学上讲,设总体分布为 FF,若随机变量 X1,X2,,XnX_1, X_2, \dots, X_n 相互独立且都服从相同的分布 FF,则称 {X1,X2,,Xn}\{X_1, X_2, \dots, X_n\} 为来自总体 FF 的一个简单随机样本。这一性质通常缩写为 i.i.d.(独立同分布)。独立同分布假设是大多数经典统计推断方法的理论基石。

随机抽样的主要方法

在实际操作中,随机样本的获取通常依赖以下几种抽样方法:

  • 简单随机抽样 (Simple Random Sampling):从总体的 NN 个个体中不放回地等概率抽取 nn 个个体,每个大小为 nn 的子集被选中的概率相同。这是最标准的随机抽样形式。
  • 分层抽样 (Stratified Sampling):将总体划分为若干互不重叠的层(strata),然后在每一层内独立进行简单随机抽样。这种方法能够提高估计精度,尤其是当各层内部差异较小、层间差异较大时。
  • 整群抽样 (Cluster Sampling):将总体分为若干群(cluster),随机抽取若干群,对被抽中群内的全部个体进行调查。这种方法在经济上更加高效,但标准误差通常较大。
  • 系统抽样 (Systematic Sampling):将总体个体按某种顺序排列,随机选择一个起点后按固定间隔抽取个体。在总体无明显周期性规律时,系统抽样可以近似等价于简单随机抽样。

随机样本的重要性

随机样本在统计学中的核心地位体现在以下几个方面。

无偏估计:在简单随机抽样下,样本均值 Xˉ=1ni=1nXi\bar{X} = \frac{1}{n}\sum_{i=1}^{n} X_i 是总体均值 μ\mu无偏估计量,即 E[Xˉ]=μE[\bar{X}] = \mu样本方差 S2S^2 同样是总体方差 σ2\sigma^2 的无偏估计量。

抽样分布与大数定律:来自随机样本的统计量具有清晰的抽样分布大数定律指出,当样本量 nn 充分大时,样本均值 Xˉ\bar{X} 以概率 1 收敛于总体均值 μ\mu中心极限定理则进一步表明,无论总体分布如何,当 nn 足够大时,标准化后的样本均值近似服从标准正态分布。这些性质是假设检验置信区间构造的理论依据。

随机样本与非随机样本的对比

在实际研究中,研究者常因成本或可行性限制而采用便利样本(如在线调查志愿者)或雪球样本(如通过已受访者招募新受访者)。这类非随机样本可能引入选择偏差,使得样本的分布与总体分布存在系统性差异,严重威胁统计推断的有效性。例如,1936 年《文学文摘》总统选举民调因使用汽车注册和电话簿等非随机抽样,错误预测阿尔夫·兰登将击败富兰克林·罗斯福,而盖洛普使用配额抽样等更科学的随机化方法做出了正确预测,这一经典案例充分说明了随机样本的重要性。

有限总体校正

在实际抽样中,当样本量 nn 相对于总体规模 NN 不可忽略时(通常取 n/N>0.05n/N > 0.05),计算标准误差时需要进行有限总体校正

FPC=NnN1\text{FPC} = \sqrt{\frac{N-n}{N-1}}

加入校正因子后,样本均值的方差为 Var(Xˉ)=σ2nNnN1\text{Var}(\bar{X}) = \frac{\sigma^2}{n} \cdot \frac{N-n}{N-1}。当 n=Nn = N(即普查)时,FPC 为零,抽样变异消失;当 nNn \ll N 时,FPC 接近 1,可以忽略。

总结

随机样本是统计推断的基石。只有通过科学的随机化机制获取样本,才能确保大数定律中心极限定理等理论工具的有效性,从而对总体特征做出可靠的推断。在数据科学飞速发展的今天,理解随机样本的本质和局限,对于正确评估任何数据驱动的结论都具有不可替代的意义。

返回百科索引