知经百科 / Z

Z-test

Z检验 (Z-test)

Z检验是一种基于标准正态分布参数检验方法,用于判断样本数据是否支持关于总体参数(通常是均值比率)的特定假设。其核心思想是:在零假设为真的前提下,将样本统计量与学生化变换后的Z统计量与标准正态分布的临界值进行比较,从而做出拒绝或不拒绝零假设的统计决策。Z检验得名于其检验统计量在零假设下服从或近似服从标准正态随机变量分布 N(0,1)N(0, 1)

Z检验是统计推断的基石之一,与t检验F检验卡方检验一起构成经典假设检验体系。其历史可追溯至高斯的正态分布理论和皮尔逊费雪等统计学家对假设检验框架的建立。

适用条件与假设

Z检验并非在所有场合都适用。其核心前提是总体方差已知样本量足够大,具体包括:

  • 正态性:若总体方差σ2\sigma^2已知,要求数据来自正态分布总体;当方差未知但样本量足够大(通常n30n \geq 30)时,由中心极限定理,样本均值的抽样分布近似正态,Z检验可近似使用。
  • 独立性:各观测值相互独立。违背独立性(如聚类抽样时间序列中的自相关)会导致标准误低估和第一类错误率膨胀。
  • 已知总体标准差:这是区分Z检验与t检验的关键条件。当σ\sigma已知时,直接使用Z检验;当σ\sigma未知且需用样本标准差ss估计时,应使用t检验

在实际研究中,总体方差σ2\sigma^2已知的情形极为罕见,因此Z检验更多应用于大样本近似场景以及总体比率检验。

检验统计量

Z统计量衡量样本估计值与零假设参数值之间的标准化距离,其一般形式为:

Z=θ^θ0SE(θ^)Z = \frac{\hat{\theta} - \theta_0}{\text{SE}(\hat{\theta})}

其中θ^\hat{\theta}为参数的样本估计量,θ0\theta_0为零假设下的参数值,SE(θ^)\text{SE}(\hat{\theta})为估计量的标准误。Z统计量的绝对值越大,表明样本证据与零假设越不一致。

单样本均值Z检验

X1,X2,,XnX_1, X_2, \ldots, X_n 为来自N(μ,σ2)N(\mu, \sigma^2)的独立同分布样本,σ2\sigma^2已知。检验H0:μ=μ0H_0: \mu = \mu_0H1:μμ0H_1: \mu \neq \mu_0

Z=Xˉμ0σ/nN(0,1)H0Z = \frac{\bar{X} - \mu_0}{\sigma / \sqrt{n}} \sim N(0, 1) \quad \text{在} H_0 \text{下}

给定显著性水平α\alpha,双侧检验的拒绝域为Z>zα/2|Z| > z_{\alpha/2},其中zα/2z_{\alpha/2}为标准正态分布的上α/2\alpha/2分位数。

两独立样本均值Z检验

设有两个独立样本,分别来自N(μ1,σ12)N(\mu_1, \sigma_1^2)N(μ2,σ22)N(\mu_2, \sigma_2^2),两总体方差均已知,样本量分别为n1n_1n2n_2。检验H0:μ1μ2=δ0H_0: \mu_1 - \mu_2 = \delta_0

Z=(Xˉ1Xˉ2)δ0σ12n1+σ22n2N(0,1)H0Z = \frac{(\bar{X}_1 - \bar{X}_2) - \delta_0}{\sqrt{\frac{\sigma_1^2}{n_1} + \frac{\sigma_2^2}{n_2}}} \sim N(0, 1) \quad \text{在} H_0 \text{下}

最常见的特例是δ0=0\delta_0 = 0(检验两总体均值是否相等)。此时若两总体方差相等(σ12=σ22=σ2\sigma_1^2 = \sigma_2^2 = \sigma^2),分母简化为σ1/n1+1/n2\sigma\sqrt{1/n_1 + 1/n_2}

总体比率Z检验

当对二项分布的总体比率pp进行推断时,Z检验是最常用的近似方法。设XBinomial(n,p)X \sim \text{Binomial}(n, p),样本比率p^=X/n\hat{p} = X/n。当np05np_0 \geq 5n(1p0)5n(1-p_0) \geq 5时,由棣莫弗-拉普拉斯定理

Z=p^p0p0(1p0)/napproxN(0,1)H0:p=p0Z = \frac{\hat{p} - p_0}{\sqrt{p_0(1 - p_0)/n}} \xrightarrow{\text{approx}} N(0, 1) \quad \text{在} H_0: p = p_0 \text{下}

对于两独立样本比率差异的检验,标准误使用合并比率估计p^=(x1+x2)/(n1+n2)\hat{p} = (x_1 + x_2)/(n_1 + n_2)

Z=p^1p^2p^(1p^)(1n1+1n2)Z = \frac{\hat{p}_1 - \hat{p}_2}{\sqrt{\hat{p}(1-\hat{p})\left(\frac{1}{n_1} + \frac{1}{n_2}\right)}}

单侧检验与双侧检验

Z检验中,备择假设的形式决定了拒绝域的位置。以单样本均值检验为例:

  • 双侧检验H1:μμ0H_1: \mu \neq \mu_0):拒绝域分布在分布的两尾,Z>zα/2|Z| > z_{\alpha/2}。例如α=0.05\alpha = 0.05时,临界值为±1.96\pm 1.96。适用于研究者不预设偏差方向的探索性分析。
  • 左侧单侧检验H1:μ<μ0H_1: \mu < \mu_0):拒绝域为Z<zαZ < -z_\alphaα=0.05\alpha = 0.05时,临界值为1.645-1.645
  • 右侧单侧检验H1:μ>μ0H_1: \mu > \mu_0):拒绝域为Z>zαZ > z_\alphaα=0.05\alpha = 0.05时,临界值为1.6451.645

单侧检验的统计功效高于双侧检验(在相同样本量和效应量下),因为它将所有显著性水平集中在一侧尾部。但选择单侧还是双侧必须在查看数据之前基于研究问题决定,否则构成数据挖掘中的p值操纵行为,会严重夸大第一类错误率。

Z检验与置信区间的关系

Z检验与置信区间估计是对偶的:一个100(1α)%100(1-\alpha)\%的置信区间恰好对应于显著性水平为α\alpha的双侧Z检验的非拒绝域。对于单样本均值,μ\mu的置信区间为:

Xˉ±zα/2σn\bar{X} \pm z_{\alpha/2} \cdot \frac{\sigma}{\sqrt{n}}

这意味着:如果零假设值μ0\mu_0落在此区间之外,双侧Z检验将在α\alpha水平上拒绝H0H_0。这种对偶关系揭示了假设检验与区间估计的统一性:置信区间不仅提供了拒绝或不拒绝的二元判断,还量化了参数估计的精度和可信范围,是比单纯报告p值更信息丰富的推断方式。

数值示例

某工厂生产的瓶装饮料标称容量为500毫升。质检人员从生产线随机抽取36瓶,测得样本均值xˉ=497.5\bar{x} = 497.5毫升。由长期生产记录知灌装量的总体标准差σ=8\sigma = 8毫升。问在α=0.05\alpha = 0.05水平下,生产线是否偏离了标称容量?

:设H0:μ=500H_0: \mu = 500H1:μ500H_1: \mu \neq 500。计算Z统计量:

Z=497.55008/36=2.51.3331.875Z = \frac{497.5 - 500}{8 / \sqrt{36}} = \frac{-2.5}{1.333} \approx -1.875

双侧临界值为z0.025=1.96z_{0.025} = 1.96。由于1.875=1.875<1.96|-1.875| = 1.875 < 1.96,不拒绝H0H_0。即现有样本证据尚不足以断定灌装量偏离标称值。对应的p值为2(1Φ(1.875))0.0612 \cdot (1 - \Phi(1.875)) \approx 0.061,略高于0.05,同样表明在5\%水平下不显著。若样本量增至n=100n = 100而其余条件不变,则Z3.125Z \approx -3.125p0.002p \approx 0.002,将强烈拒绝H0H_0——这直观地展示了大样本下Z检验对微小偏差的检测能力。

Z检验与t检验的关系

Z检验与t检验的本质区别在于对σ\sigma的处理:

  • Z检验:要求σ\sigma已知,检验统计量精确服从N(0,1)N(0,1)(正态总体下)。
  • t检验σ\sigma未知,以样本标准差ss替代,检验统计量服从自由度为n1n-1学生t分布

两者在数学上紧密关联:t分布的尾部比标准正态更厚(反映了估计σ\sigma引入的额外不确定性),但随着自由度增大,tνt_{\nu}分布收敛于N(0,1)N(0,1)。当样本量nn \to \infty时,spσs \xrightarrow{p} \sigma,t检验与Z检验给出的推断结果渐近一致。因此,在大样本(n>100n > 100左右)的实践中,即使使用s替代σ\sigma,直接使用Z临界值(如双侧5\%下1.96)也是可接受的近似。

p值与统计功效

给定计算出的Z统计量,双侧检验的p值为:

p=2P(Z>zobs)=2(1Φ(zobs))p = 2 \cdot P(Z > |z_{\text{obs}}|) = 2 \cdot (1 - \Phi(|z_{\text{obs}}|))

其中Φ()\Phi(\cdot)为标准正态累积分布函数。若p<αp < \alpha,则拒绝H0H_0

Z检验的统计功效取决于效应量(effect size)、样本量和显著性水平。对于单样本均值检验H0:μ=μ0H_0: \mu = \mu_0H1:μ=μ1H_1: \mu = \mu_1,非中心参数为n(μ1μ0)/σ\sqrt{n}(\mu_1 - \mu_0)/\sigma,功效为:

1β=P(Z>zα/2(μ1μ0)nσ)+P(Z<zα/2(μ1μ0)nσ)1 - \beta = P\left( Z > z_{\alpha/2} - \frac{(\mu_1 - \mu_0)\sqrt{n}}{\sigma} \right) + P\left( Z < -z_{\alpha/2} - \frac{(\mu_1 - \mu_0)\sqrt{n}}{\sigma} \right)

基于此公式可进行样本量计算:在给定期望功效1β1-\beta和可检测最小效应量下反解所需nn

应用与局限

Z检验在质量控制(如六西格玛管理中的过程能力分析)、市场研究(如比较两个广告方案的转化率)、生物统计(如检验药物有效率是否达到预设标准)和计量经济学大样本推断中均有广泛应用。在线性回归分析中,当扰动项方差已知或使用稳健标准误做大样本推断时,单个系数的显著性检验本质上也是Z检验。

Z检验的核心局限在于:(1) 要求总体方差已知,这一条件在真实数据中几乎不可能满足;(2) 小样本且方差未知时检验失真严重,必须使用t检验;(3) 依赖渐近正态近似时(如比率检验),小样本或极端比率下近似精度不足,应使用精确二项检验似然比检验。在实践中,Z检验更多被视为一种教学模型和大样本快捷工具,而非日常数据分析的首选。

返回百科索引