知经百科 / Z

正态概率图

正态概率图 (Normal Probability Plot)

正态概率图,亦称正态Q-Q图(Quantile-Quantile Plot),是一种用于直观判断一组数据是否服从正态分布的图形化诊断工具。其核心思想是将样本数据的经验分位数与理论正态分布的分位数进行比较:若数据确实来自正态总体,则散点应大致沿一条直线排列。正态概率图广泛应用于回归分析的残差诊断、方差分析的假设检验以及工业质量控制等领域,是探索性数据分析中不可或缺的工具。

基本原理

X1,X2,,XnX_1, X_2, \ldots, X_n 为从某一分布中抽取的独立同分布样本,其顺序统计量记为 X(1)X(2)X(n)X_{(1)} \leq X_{(2)} \leq \cdots \leq X_{(n)}。对于第 ii 个顺序统计量,其累积概率的经验估计——即绘图位置(Plotting Position)——有多种常用公式。最经典的方案为:

pi=i0.5np_i = \frac{i - 0.5}{n}

此外,pi=in+1p_i = \frac{i}{n+1}pi=i3/8n+1/4p_i = \frac{i - 3/8}{n + 1/4} 等变体也各有适用场景。设 Φ\Phi 为标准正态分布的累积分布函数,则第 ii 个理论正态分位数为:

qi=Φ1(pi)q_i = \Phi^{-1}(p_i)

其中 Φ1\Phi^{-1} 为标准正态分布的分位数函数。正态概率图即为 (qi,X(i))(q_i, X_{(i)}) 的散点图,i=1,2,,ni = 1, 2, \ldots, n。若数据服从正态分布 N(μ,σ2)N(\mu, \sigma^2),则理论上存在线性关系 X(i)μ+σqiX_{(i)} \approx \mu + \sigma q_i,这正是参考直线的依据。

构造步骤

正态概率图的具体构造分为以下步骤:首先,将样本数据按升序排列,得到顺序统计量 X(1),,X(n)X_{(1)}, \ldots, X_{(n)};其次,对每个 ii 计算绘图位置 pip_i;再次,通过标准正态分位数函数 Φ1\Phi^{-1} 求得对应的理论分位数 qiq_i;最后,以理论分位数为横轴、样本顺序统计量为纵轴,绘制散点图并添加一条参考线。参考线通常穿过数据的第一四分位数和第三四分位数所对应的点,或直接采用 (0,Xˉ)(0, \bar{X})(1,Xˉ+s)(1, \bar{X} + s) 两点确定,其中 Xˉ\bar{X} 为样本均值、ss 为样本标准差。

图形解读

正态概率图的解读依赖于散点相对于参考直线的偏离模式。若样本确实服从正态分布,数据点将紧密围绕参考直线波动,仅在两端因抽样变异而略有离散。系统性偏离则对应特定的分布特征:

  • S形或反S形弯曲:表明数据分布的尾部与正态分布存在差异。S形曲线意味着数据具有重尾(Heavy Tail)特征——两端实际值比正态预期更极端,常见于金融收益率等具有峰度过高的序列;反S形则指示轻尾(Light Tail),即极端观测少于正态预期,多见于有界数据。
  • U形或弓形弯曲:散点呈系统性弧度偏离直线,通常意味着分布偏度(Skewness)非零。若曲线中部上凸、两端下沉,提示右偏(正偏);反之则为左偏(负偏)。例如,收入数据常呈现右偏,其正态概率图会明显偏离对角线。
  • 离散跳跃或分层:当数据存在大量重复值(ties)或来自离散分布时,散点将呈现阶梯状排列,无法形成连续的线性趋势。
  • 离群点:个别点远离主体点群,在图形右端或左端孤悬,提示可能存在异常值,需进一步探查其成因。

与P-P图的比较

除正态概率图外,另一种相近的图形工具为P-P图(Probability-Probability Plot)。P-P图绘制的是经验累积概率与理论累积概率的对照关系,即 (Fn(X(i)),Φ((X(i)μ)/σ))(F_n(X_{(i)}), \Phi((X_{(i)} - \mu)/\sigma)) 的散点图。两者虽同属基于分位数的诊断图形,但关注点有所不同:Q-Q图在尾部区域具有更高的分辨率,能更灵敏地检测分布的尾部偏离;而P-P图在分布中心区域的判别力更优。因此,在正态性检验中,正态概率图(Q-Q图)的使用更为普遍。

与形式化检验的关系

正态概率图属于图形化诊断方法,其结果具有主观性——不同分析者对同一图形的"偏离程度"可能做出不同判断。为此,统计学发展了一系列形式化的正态性检验方法,其中Shapiro-Wilk检验Anderson-Darling检验功效较高、应用最广。实践中,图形方法与形式检验常结合使用:正态概率图用于初步筛查和向非技术受众呈现结果,形式检验则提供具有统计显著性的量化证据。此外,当样本量较小时,正态概率图的判断可能不稳定——同一分布的不同样本可能呈现出差异较大的图形,需谨慎解读;一般建议样本量至少达到25至30以上,图形才具有可靠的诊断价值。

实际应用

正态概率图在应用统计学中扮演着关键角色。在线性回归诊断中,分析者通过绘制残差的正态概率图来验证正态性假设——若残差严重偏离直线,则表明正态性假设可能不成立,需考虑变量变换(如Box-Cox变换)或改用广义线性模型。在统计过程控制中,正态概率图用于判断质量特征是否服从正态分布,以合理设定控制上下限。在计量经济学中,正态概率图辅助判断回归扰动项是否满足正态性,尤其在使用最大似然估计时,该假设直接影响估计量的有效性。在心理学和医学研究中,正态概率图常用于评估量表得分和生物指标的分布形态,为后续参数检验的选用提供依据。

软件实现

主流统计软件均内置正态概率图功能。在R语言中,\verb|qqnorm()| 函数绘制正态Q-Q图,\verb|qqline()| 添加参考线;Python中 \verb|scipy.stats.probplot| 和 \verb|statsmodels.api.qqplot| 提供等价功能;Stata的 \verb|qnorm| 命令和SAS的 \verb|PROC UNIVARIATE| 同样支持该图形的生成。现代商业智能平台也逐步纳入概率图功能,降低了非编程用户的技术门槛。

返回百科索引