随机样本 (random sample)
随机样本 (Random Sample)
随机样本是统计学和计量经济学中最基础的概念之一,指通过随机化机制从目标总体中选取的一部分个体或观测值。随机抽样的核心目标在于确保样本对总体具有代表性,从而允许研究者基于样本数据对总体特征进行统计推断。
定义
从数学上讲,设总体分布为 ,若随机变量 相互独立且都服从相同的分布 ,则称 为来自总体 的一个简单随机样本。这一性质通常缩写为 i.i.d.(独立同分布)。独立同分布假设是大多数经典统计推断方法的理论基石。
随机抽样的主要方法
在实际操作中,随机样本的获取通常依赖以下几种抽样方法:
- 简单随机抽样 (Simple Random Sampling):从总体的 个个体中不放回地等概率抽取 个个体,每个大小为 的子集被选中的概率相同。这是最标准的随机抽样形式。
- 分层抽样 (Stratified Sampling):将总体划分为若干互不重叠的层(strata),然后在每一层内独立进行简单随机抽样。这种方法能够提高估计精度,尤其是当各层内部差异较小、层间差异较大时。
- 整群抽样 (Cluster Sampling):将总体分为若干群(cluster),随机抽取若干群,对被抽中群内的全部个体进行调查。这种方法在经济上更加高效,但标准误差通常较大。
- 系统抽样 (Systematic Sampling):将总体个体按某种顺序排列,随机选择一个起点后按固定间隔抽取个体。在总体无明显周期性规律时,系统抽样可以近似等价于简单随机抽样。
随机样本的重要性
随机样本在统计学中的核心地位体现在以下几个方面。
无偏估计:在简单随机抽样下,样本均值 是总体均值 的无偏估计量,即 。样本方差 同样是总体方差 的无偏估计量。
抽样分布与大数定律:来自随机样本的统计量具有清晰的抽样分布。大数定律指出,当样本量 充分大时,样本均值 以概率 1 收敛于总体均值 。中心极限定理则进一步表明,无论总体分布如何,当 足够大时,标准化后的样本均值近似服从标准正态分布。这些性质是假设检验和置信区间构造的理论依据。
随机样本与非随机样本的对比
在实际研究中,研究者常因成本或可行性限制而采用便利样本(如在线调查志愿者)或雪球样本(如通过已受访者招募新受访者)。这类非随机样本可能引入选择偏差,使得样本的分布与总体分布存在系统性差异,严重威胁统计推断的有效性。例如,1936 年《文学文摘》总统选举民调因使用汽车注册和电话簿等非随机抽样,错误预测阿尔夫·兰登将击败富兰克林·罗斯福,而盖洛普使用配额抽样等更科学的随机化方法做出了正确预测,这一经典案例充分说明了随机样本的重要性。
有限总体校正
在实际抽样中,当样本量 相对于总体规模 不可忽略时(通常取 ),计算标准误差时需要进行有限总体校正:
加入校正因子后,样本均值的方差为 。当 (即普查)时,FPC 为零,抽样变异消失;当 时,FPC 接近 1,可以忽略。
总结
随机样本是统计推断的基石。只有通过科学的随机化机制获取样本,才能确保大数定律和中心极限定理等理论工具的有效性,从而对总体特征做出可靠的推断。在数据科学飞速发展的今天,理解随机样本的本质和局限,对于正确评估任何数据驱动的结论都具有不可替代的意义。