知经百科 / T

统计实验

统计实验 (Statistical Experiment)

统计实验 (Statistical Experiment),亦称实验设计 (Design of Experiments, DOE),是由 Ronald A. Fisher 在 20 世纪 20 年代于 Rothamsted 农业实验站系统建立的一套方法论。它研究如何在受控条件下,有计划地收集数据并分析处理效应,以实现对因果关系的可靠推断。与观测研究不同,统计实验的核心特征是研究者主动干预并随机分配处理,从而切断混杂因素的影响路径。

Fisher三原则

Fisher 提出了统计实验的三项基本原则:

一、随机化 (Randomization):将实验单元随机分配到各处理组。随机化消除了已知和未知混杂变量与处理分配之间的系统性关联,使各组在预期意义上可比。它是因果推断有效性的根基——没有随机化,就无法排除选择偏差的威胁。随机化也为假设检验置信区间的统计推断提供了概率基础。

二、重复 (Replication):即每个处理有多个独立的实验单元。重复有三重功能:其一,提供对实验误差的估计(若无重复则无法估计变异);其二,通过增大样本量提高估计精度和统计功效;其三,使结论可推广至更广泛的总体。

三、局部控制 (Local Control)——亦称区组化 (Blocking):将已知且不可控但可测量的变异来源(如地块肥力、批次差异、个体基线特征)划分为区组,在区组内部进行比较。区组化通过移除已知变异来提高处理效应估计的精度,与随机化配合使用可实现最有效的误差控制。

常见实验设计

完全随机设计 (Completely Randomized Design, CRD) 是最简单的基本设计:将实验单元完全随机地分配到各处理。其优点是灵活、分析简便(单因素ANOVA),但要求实验单元高度同质;当存在显著异质性时效率低下。

随机区组设计 (Randomized Block Design, RBD) 将实验单元按某个特征分为若干区组,在每个区组内随机分配处理。区组间的变异被从误差中分离,从而提高了检验的灵敏度。其数学模型为 Yij=μ+τi+βj+ϵijY_{ij} = \mu + \tau_i + \beta_j + \epsilon_{ij},其中 βj\beta_j 为区组效应。若区组效应显著,RBD 的误差方差显著小于 CRD。

因子设计 (Factorial Design) 同时考察两个或更多因素的主效应和交互效应。一个 2×22 \times 2 因子设计包含两个因素,每个因素有两个水平,共四个处理组合。其主要优势有三:一是效率——比逐一进行单因素实验节省资源;二是能估计交互作用,这在单因素实验中是无法获得的;三是结论的适用范围更广。

拉丁方设计 (Latin Square Design) 用两个区组变量(行列双向)进行双重局部控制,适用于存在两个已知干扰变异来源的场景。每个处理在每一行和每一列中恰好出现一次。

样本量与功效分析

实验设计阶段必须进行功效分析 (Power Analysis),确定在给定效应量和显著性水平下所需的最小样本量。统计功效 1β1 - \beta 是当备择假设为真时正确拒绝零假设的概率,通常要求达到 0.80 以上。功效取决于四个因素的相互作用:效应量 δ\delta、样本量 nn、显著性水平 α\alpha 以及误差方差 σ2\sigma^2。在实际操作中,研究者可设定目标功效后反向求解所需 nn。样本量不足导致功效过低,无法检测到有意义的效应;样本量过大则浪费资源,且可能使微小的实际不重要的效应获得统计显著性。

内部效度与外部效度

内部效度 (Internal Validity) 指实验结论在实验参与者范围内是否无偏地反映了真实的因果效应。威胁内部效度的因素包括:未充分随机化导致的混杂、中途退出 (Attrition)、实验者偏差、安慰剂效应、以及受试者行为因被观察而改变(霍桑效应)。良好的实验设计通过随机化、盲法和严格的操作规程保护内部效度。

外部效度 (External Validity) 指实验结论能否推广至其他人群、环境和时间。实验室实验因条件高度受控,内部效度高但外部效度常受质疑。田野实验 (Field Experiment) 在真实世界中进行随机化,在内部和外部效度之间寻求更好的平衡。近年来兴起的自然实验则利用外生冲击实现近似随机化的效果。

与观测研究的根本区别

统计实验与观测研究的根本区别在于处理分配机制。实验由研究者控制分配,可实现随机化,因此处理与潜在结果独立:T(Y(0),Y(1))T \perp (Y(0), Y(1))。观测研究则依赖自然发生的变异,始终面临未观测混杂的威胁。断点回归双重差分工具变量等准实验方法试图在观测数据中模仿随机实验的条件,但各自依赖不可直接验证的识别假设。统计实验——尤其是随机对照试验——因此被视为因果推断的"金标准"。

统计实验的方法论已从农业扩展到临床医学、互联网产品(A/B 测试)、经济学政策评估(随机对照试验)、心理学、工业工程等几乎所有实证科学领域,成为现代科学获取因果知识的核心工具。

返回百科索引