两独立样本均值差异的检验 (Test for the Difference between Two Independent Sample Means)
两独立样本均值差异的检验,通常称为两样本t检验 (Two-Sample t-test),是一种在统计推断中被广泛使用的假设检验方法。其核心目标是,基于从两个独立的总体中分别抽取的两个样本,来判断这两个总体的均值是否存在显著差异。例如,比较两种教学方法下学生的平均考试成绩,或比较新药与安慰剂对病患生理指标的影响。该检验是计量经济学、生物统计学和社会科学等领域进行实验数据分析的基础工具。
检验逻辑与基本假设
假设有两个独立总体,均值分别为 μ1 和 μ2,从中分别抽取样本得到 xˉ1 和 xˉ2。由于抽样误差的存在,即使 μ1=μ2,样本均值也几乎不可能完全相等。因此核心问题是:观测到的样本均值之差 (xˉ1−xˉ2) 在多大程度上由抽样变异引起,又在多大程度上反映真实差异? 两样本t检验通过构建标准化检验统计量来回答。
进行检验前须满足三个关键假设:
- 独立性 (Independence):两个样本相互独立,样本内部观测值亦独立。随机分组可确保独立性。
- 正态性 (Normality):两总体服从正态分布。根据中心极限定理,当两样本容量足够大时(通常 n1≥30 且 n2≥30),可放宽此要求。
- 方差齐性或非齐性:方差齐性假设两总体方差相等 σ12=σ22;方差非齐性则不假设相等。这一区分决定使用何种t检验形式。
检验统计量计算
合并t检验(方差齐性)
当有理由相信两总体方差相等时,使用合并t检验 (Pooled t-test)。先计算合并样本方差:
sp2=n1+n2−2(n1−1)s12+(n2−1)s22
其中 s12,s22 为样本方差,n1,n2 为样本容量。检验统计量为:
t=sp2(n11+n21)(xˉ1−xˉ2)−D0
D0 为原假设中假设的均值差(通常 D0=0),该统计量服从自由度为 df=n1+n2−2 的t分布。
韦尔奇t检验(方差非齐性)
在大多数实际应用中推荐使用韦尔奇t检验 (Welch's t-test),它不要求方差齐性,更稳健。统计量为:
t=n1s12+n2s22(xˉ1−xˉ2)−D0
自由度采用韦尔奇-萨特思韦特方程近似:
df≈n1−1(s12/n1)2+n2−1(s22/n2)2(n1s12+n2s22)2
统计决策与置信区间
假设设立
原假设 H0 通常为总体均值无差异,备择假设 Ha 为存在差异:
- 双尾检验:H0:μ1=μ2 vs Ha:μ1=μ2
- 右尾检验:H0:μ1≤μ2 vs Ha:μ1>μ2
- 左尾检验:H0:μ1≥μ2 vs Ha:μ1<μ2
决策方法
临界值法:设定显著性水平 α(如0.05),根据 α 和自由度查临界值 tcritical。若 ∣t∣>tcritical,拒绝 H0。
p值法:计算与统计量t对应的p值。p值是在 H0 为真时获得当前或更极端统计量的概率。若 p<α,拒绝 H0。
若拒绝 H0,则有足够统计证据表明两总体均值存在显著差异;若未拒绝,则证据不足。
均值差异的置信区间
为 μ1−μ2 构建置信区间:
(xˉ1−xˉ2)±tα/2,df×标准误
合并t检验的标准误为 sp2(1/n1+1/n2),自由度为 n1+n2−2;Welch检验的标准误为 s12/n1+s22/n2。若置信区间包含0,则与未拒绝 H0 一致;若不包含0,则与拒绝 H0 一致。
与其他检验的关系
两独立样本t检验与Z检验的区别在于,Z检验要求两总体方差已知,这在实践中较少见,故t检验更常用。与方差分析(ANOVA)的关系上,两独立样本t检验可视为方差分析在比较两个组别时的特例。当需比较三个或更多组别均值时须使用ANOVA。该检验依赖独立同分布条件,违反独立性假设时应采用配对t检验或其他相关样本方法。