最小样本量
最小样本量 (Minimum Sample Size)
最小样本量(Minimum Sample Size)是实验设计和统计推断中的核心概念,指在给定的统计功效、显著性水平和预期效应量下,能够以预设概率检测到具有实际意义的效应所需的最少观测单位数量。其数学本质是在第一类错误()、第二类错误()、效应量(effect size)和样本量()四者之间建立定量关系,使得研究者可以在实验开始前确定足够的样本规模,避免因样本过小导致研究缺乏统计效力,或因样本过大造成资源浪费。
功效分析与最小样本量的关系
功效分析(Power Analysis)是确定最小样本量的主要方法论工具。统计功效()定义为当备择假设为真时正确拒绝零假设的概率。在标准的 Neyman-Pearson 假设检验框架中,四个关键参数相互约束:
其中任意三个参数确定后,第四个参数即被唯一确定。因此,先验功效分析(a priori power analysis)的操作逻辑为:研究者预先指定可接受的 (通常为 0.05)、期望的统计功效(通常为 0.80 或 0.90)以及预期检测的最小效应量,然后求解所需的最小样本量 。与之相对,事后功效分析(post hoc power analysis)在数据收集完成后进行,但由于其与已获得的 值存在一一对应关系,其信息增量有限,目前主流方法论建议以置信区间宽度替代事后功效作为精度的度量。
决定最小样本量的关键因素
最小样本量同时受以下四个因素的控制,各因素的影响方向如下:
- 显著性水平 : 越小(越严格),所需样本量越大。将 从 0.05 降至 0.01 会显著增大 ,因为需要更极端的检验统计量才能拒绝零假设。
- 统计功效 :目标功效越高,所需样本量越大。将功效从 0.80 提升至 0.95 通常需要将样本量增加约 50\% 以上。
- 效应量(Effect Size):预期检测的效应越小,所需样本量越大。效应量通常以标准化度量表示——如Cohen's d(均值之差除以标准差)、皮尔逊相关系数 、比值比(odds ratio)或决定系数 。检测"小"效应(如 Cohen's )所需的样本量可达检测"大"效应()的 16 倍。
- 总体变异性 :数据的内在变异性越大,所需样本量越大。因为更大的噪声需要更多的观测来从中提取信号。
这四个因素之间的定量关系因检验类型而异,但均满足相同的基本方向:更严格的推断(更小的 、更高的功效、更小的效应)无一例外地要求更大的样本量。
常见检验的最小样本量公式
单样本均值检验。设检验 对 (双侧),预期效应量为 ,所需最小样本量为:
其中 为标准正态分布的 分位数。当 , 时,,,简化为 。
两独立样本均值比较。假设两组方差相等且样本量均衡(),每组所需最小样本量为:
这是临床随机对照试验(RCT)中最常用的公式之一。因为需要比较两组,总样本量为 。
比例的单样本检验。设检验 对 ,基于正态近似的最小样本量为:
该公式在 接近 0 或 1 时正态近似可能失效,此时应使用基于精确二项检验或费舍尔精确检验的方法。
线性回归。对于检验单个回归系数 ,所需样本量的计算需考虑多重共线性的影响。若定义 为以 为因变量、其余预测变量为自变量回归的决定系数,则:
越大(共线性越强),所需样本量越大。对于多元回归的整体 检验,Cohen 建议使用 作为效应量度量,其中 为 0.02、0.15、0.35 分别对应小、中、大效应。
经验法则与其局限性
统计实践中流传着若干关于最小样本量的经验法则(rules of thumb),尽管简便,但因其忽略了效应量、功效和具体研究背景而常受到批评:
- 每组 30 法则:源于中心极限定理的直觉——当每组样本量 时,样本均值的抽样分布近似正态。但该法则仅适用于均值的正态近似,不保证足够的功效。若效应量为小到中等,每组 30 远不足以检测到真实效应。
- 每个变量 10 个事件:在逻辑回归中,为避免过拟合和估计偏倚,通常建议每个预测变量至少需要 10 个"事件"(即 的观测)。然而模拟研究表明,当事件数不足时,这一规则可放宽至每变量 5–9 个事件,但仅适用于无强混杂且效应量较大的情境。
- Green 回归法则:Green (1991) 提出,对于多元回归中整体 的检验,( 为预测变量数)用于检验整体拟合, 用于检验单个预测变量。但这些法则假定了中等效应量和 0.80 的功效水平。
- 因子分析每变量 5–10 个观测:探索性因子分析通常要求样本量至少为变量数的 5–10 倍,或绝对样本量 ,但这些仅是确保相关矩阵稳定性的经验指引,而非严格推论性检验的样本量要求。
这些经验法则的共同缺陷在于:它们将效应量、功效和具体研究目标排除在计算之外,可能导致在某些领域(需检测微小效应时)严重低效,而在另一些领域(效应巨大时)又不必要地浪费资源。严谨的研究设计应始终以基于功效分析的计算结果取代经验法则。
实际应用中的考量
非响应与损耗率调整。功效分析得出的 是最终分析所需的有效样本量。在纵向研究和调查中,需根据预期的无应答率和失访率(attrition rate)对样本量进行向上调整。设预期损耗率为 (如 表示 20\% 的样本不可用),则初始招募量应为 。
多重比较校正。当研究涉及多个假设检验时,需通过Bonferroni校正或错误发现率(FDR)控制族系错误率。例如,若在 Bonferroni 校正下将 调整为 ( 为检验个数),相应的最小样本量会显著增加。在临床试验的适应性设计中,中间分析(interim analyses)也需调整 水平(如 O'Brien-Fleming 边界),从而对样本量产生影响。
样本量计算的实践建议。研究者可借助专用软件(如G*Power、R 中的 \texttt{pwr} 包、Stata 的 \texttt{power} 命令或 SAS 的 PROC POWER)进行精确计算。在没有明确先验效应量估计时,可参考类似研究的已发表效应量、元分析结果或基于领域公认的最小临床重要差异(MCID)来设定目标效应量。同时,Cohen 提出的小()、中()、大()效应量基准虽被广泛应用,但其合理性取决于具体研究领域——在某些学科中, 可能已具有深远的实质影响。此外,最小样本量计算应被视为实验设计的一部分,与随机化方案、控制变量选择和统计分析方法一并预先注册(preregistration),以增强研究的透明度和可重复性。
小结
最小样本量的确定是连接统计理论与实证研究设计的桥梁。其核心在于功效分析框架中 、、效应量和样本量四者之间的定量约束关系。理解这四者的交互方向——更严格的推断、更小的效应和更高的功效同向推动样本量增加——使研究者能够做出知情的设计决策,在资源约束与统计严谨性之间寻求最优平衡。尽管经验法则提供了简便的起点,严谨的实证研究应始终以基于功效分析的计算为准,并充分考虑非响应、多重比较和领域特异性效应量等实际因素。