正态分布的可加性 (Additivity of Normal Distributions)
正态分布的可加性 (Additivity / Reproductive Property of the Normal Distribution) 是正态分布 (Normal Distribution) 最核心的代数性质之一。它表明:若一组相互独立的随机变量均服从正态分布,则它们的任意线性组合也服从正态分布。这一性质在统计推断 、计量经济学 和金融计量 中具有不可替代的基础地位——它是最小二乘估计 (OLS) 的有限样本理论、方差分析 (ANOVA) 和许多假设检验程序得以成立的统计学基石。
数学表述
设 X 1 , X 2 , … , X n X_1, X_2, \ldots, X_n X 1 , X 2 , … , X n 为相互独立的随机变量,其中每个 X i X_i X i 服从均值为 μ i \mu_i μ i 、方差为 σ i 2 \sigma_i^2 σ i 2 的正态分布,即 X i ∼ N ( μ i , σ i 2 ) X_i \sim N(\mu_i, \sigma_i^2) X i ∼ N ( μ i , σ i 2 ) 。则对于任意实数常数 a 1 , a 2 , … , a n a_1, a_2, \ldots, a_n a 1 , a 2 , … , a n 和 b b b ,其线性组合:
Y = a 1 X 1 + a 2 X 2 + ⋯ + a n X n + b Y = a_1 X_1 + a_2 X_2 + \cdots + a_n X_n + b Y = a 1 X 1 + a 2 X 2 + ⋯ + a n X n + b
服从正态分布,且其均值和方差分别为:
Y ∼ N ( ∑ i = 1 n a i μ i + b , ∑ i = 1 n a i 2 σ i 2 ) Y \sim N\left( \sum_{i=1}^{n} a_i \mu_i + b,\; \sum_{i=1}^{n} a_i^2 \sigma_i^2 \right) Y ∼ N ( i = 1 ∑ n a i μ i + b , i = 1 ∑ n a i 2 σ i 2 )
两种常见特例 :
和的可加性 :取 a i = 1 , b = 0 a_i = 1, b = 0 a i = 1 , b = 0 ,则 X 1 + X 2 + ⋯ + X n ∼ N ( ∑ μ i , ∑ σ i 2 ) X_1 + X_2 + \cdots + X_n \sim N\left( \sum \mu_i,\; \sum \sigma_i^2 \right) X 1 + X 2 + ⋯ + X n ∼ N ( ∑ μ i , ∑ σ i 2 ) 。即独立正态变量之和仍为正态,均值相加,方差相加。差的可加性 :取 n = 2 , a 1 = 1 , a 2 = − 1 , b = 0 n = 2, a_1 = 1, a_2 = -1, b = 0 n = 2 , a 1 = 1 , a 2 = − 1 , b = 0 ,则 X 1 − X 2 ∼ N ( μ 1 − μ 2 , σ 1 2 + σ 2 2 ) X_1 - X_2 \sim N(\mu_1 - \mu_2,\; \sigma_1^2 + \sigma_2^2) X 1 − X 2 ∼ N ( μ 1 − μ 2 , σ 1 2 + σ 2 2 ) 。注意:方差仍为两者之和(而非差),因为 ( − 1 ) 2 = 1 (-1)^2 = 1 ( − 1 ) 2 = 1 。
矩母函数证明
正态分布可加性的标准证明工具是矩母函数 (Moment Generating Function, MGF)。若 X ∼ N ( μ , σ 2 ) X \sim N(\mu, \sigma^2) X ∼ N ( μ , σ 2 ) ,其矩母函数为:
M X ( t ) = E [ e t X ] = exp ( μ t + 1 2 σ 2 t 2 ) M_X(t) = \mathbb{E}[e^{tX}] = \exp\left( \mu t + \frac{1}{2}\sigma^2 t^2 \right) M X ( t ) = E [ e tX ] = exp ( μ t + 2 1 σ 2 t 2 )
对于独立随机变量,线性组合 Y = ∑ a i X i + b Y = \sum a_i X_i + b Y = ∑ a i X i + b 的矩母函数为各分量矩母函数之积(利用独立性):
M Y ( t ) = E [ e t Y ] = E [ e t ( ∑ a i X i + b ) ] = e t b ∏ i = 1 n E [ e t a i X i ] = e t b ∏ i = 1 n M X i ( a i t ) = e t b ∏ i = 1 n exp ( μ i ( a i t ) + 1 2 σ i 2 ( a i t ) 2 ) = exp ( ( ∑ a i μ i + b ) t + 1 2 ( ∑ a i 2 σ i 2 ) t 2 ) \begin{aligned}
M_Y(t) &= \mathbb{E}[e^{tY}] = \mathbb{E}\left[ e^{t(\sum a_i X_i + b)} \right] \\
&= e^{tb} \prod_{i=1}^{n} \mathbb{E}\left[ e^{t a_i X_i} \right] \\
&= e^{tb} \prod_{i=1}^{n} M_{X_i}(a_i t) \\
&= e^{tb} \prod_{i=1}^{n} \exp\left( \mu_i (a_i t) + \frac{1}{2}\sigma_i^2 (a_i t)^2 \right) \\
&= \exp\left( \left(\sum a_i \mu_i + b\right) t + \frac{1}{2} \left(\sum a_i^2 \sigma_i^2\right) t^2 \right)
\end{aligned} M Y ( t ) = E [ e t Y ] = E [ e t ( ∑ a i X i + b ) ] = e t b i = 1 ∏ n E [ e t a i X i ] = e t b i = 1 ∏ n M X i ( a i t ) = e t b i = 1 ∏ n exp ( μ i ( a i t ) + 2 1 σ i 2 ( a i t ) 2 ) = exp ( ( ∑ a i μ i + b ) t + 2 1 ( ∑ a i 2 σ i 2 ) t 2 )
该结果恰好是 N ( ∑ a i μ i + b , ∑ a i 2 σ i 2 ) N\left( \sum a_i \mu_i + b,\; \sum a_i^2 \sigma_i^2 \right) N ( ∑ a i μ i + b , ∑ a i 2 σ i 2 ) 的矩母函数形式。由于矩母函数唯一确定分布(在 MGF 存在的邻域内),可加性得证。
也可以使用特征函数 (Characteristic Function) 进行完全类似的证明,且特征函数始终存在(无需 MGF 的存在性假设),论证更为一般。
多元正态分布的推广
可加性在多元框架下有自然的推广。设 X ∼ N p ( μ , Σ ) \mathbf{X} \sim N_p(\boldsymbol{\mu}, \boldsymbol{\Sigma}) X ∼ N p ( μ , Σ ) 为 p p p 维多元正态分布 (Multivariate Normal Distribution),则对于任意 q × p q \times p q × p 常数矩阵 A \mathbf{A} A 和 q q q 维常数向量 b \mathbf{b} b ,有:
A X + b ∼ N q ( A μ + b , A Σ A ⊤ ) \mathbf{A}\mathbf{X} + \mathbf{b} \sim N_q(\mathbf{A}\boldsymbol{\mu} + \mathbf{b},\; \mathbf{A}\boldsymbol{\Sigma}\mathbf{A}^\top) AX + b ∼ N q ( A μ + b , A Σ A ⊤ )
这一性质说明多元正态分布在仿射变换下是封闭的,而可加性可视为其特殊形式:取 A \mathbf{A} A 为行向量 ( a 1 , … , a n ) (a_1, \ldots, a_n) ( a 1 , … , a n ) 且 Σ \boldsymbol{\Sigma} Σ 为对角矩阵 diag ( σ 1 2 , … , σ n 2 ) \operatorname{diag}(\sigma_1^2, \ldots, \sigma_n^2) diag ( σ 1 2 , … , σ n 2 ) 即可回归到一元情形。该结论对理解OLS估计量 的正态性至关重要——在经典正态线性回归模型中,OLS 估计量 β ^ = ( X ⊤ X ) − 1 X ⊤ y \hat{\boldsymbol{\beta}} = (\mathbf{X}^\top\mathbf{X})^{-1}\mathbf{X}^\top\mathbf{y} β ^ = ( X ⊤ X ) − 1 X ⊤ y 作为 y \mathbf{y} y (多元正态)的线性变换,自然服从多元正态分布。
与中心极限定理的关系
正态分布的可加性应与中心极限定理 (Central Limit Theorem, CLT) 清晰区分。可加性要求各分量本身 已服从正态分布,结论是精确的(有限样本严格成立)。而中心极限定理处理的是任意分布 的独立同分布序列,其正态性仅是渐近近似。换言之:
可加性:正态 + + + 正态 = = = 正态(精确,有限样本)。 CLT:任意分布的和 → d \xrightarrow{d} d 正态(近似,大样本)。
两者的交汇点在于:若已有正态性,则和的分布精确已知(可加性);若原始分布未知,则用 CLT 在大样本条件下近似。可加性为 CLT 提供了一种「自洽性」检验——在 CLT 适用的极限情形下,正态分布的极限仍应为正态。
独立性假设的必要性
可加性强烈依赖于独立性 假设。若 X X X 和 Y Y Y 均服从正态分布但不独立 ,其和未必服从正态分布。例如,设 X ∼ N ( 0 , 1 ) X \sim N(0, 1) X ∼ N ( 0 , 1 ) ,定义 Y = ∣ X ∣ ⋅ sgn ( X ) Y = |X| \cdot \operatorname{sgn}(X) Y = ∣ X ∣ ⋅ sgn ( X ) (即 Y = X Y = X Y = X ),则 X + Y = 2 X ∼ N ( 0 , 4 ) X + Y = 2X \sim N(0, 4) X + Y = 2 X ∼ N ( 0 , 4 ) ——此例中因完全相关,和仍为正态。但若构造更复杂的相依结构(如混合分布),和可能呈现出双峰或偏态形态,偏离正态性。
更一般的结论是:若 ( X , Y ) (X, Y) ( X , Y ) 服从联合正态分布 (Bivariate Normal),则 a X + b Y aX + bY a X + bY 服从正态分布,即使 X X X 和 Y Y Y 相关。因为此时 ( X , Y ) ⊤ (X, Y)^\top ( X , Y ) ⊤ 可写为独立正态变量的线性变换。但当边际分布为正态而联合分布非正态时(这在统计学中是可能的),可加性失效。
应用场景
正态分布可加性在多个领域具有核心应用:
线性回归推断 :在经典正态线性模型中,误差项 ε i ∼ N ( 0 , σ 2 ) \varepsilon_i \sim N(0, \sigma^2) ε i ∼ N ( 0 , σ 2 ) 相互独立,回归系数估计量 β ^ j = β j + ∑ c i j ε i \hat{\beta}_j = \beta_j + \sum c_{ij} \varepsilon_i β ^ j = β j + ∑ c ij ε i 作为独立正态误差的线性组合,精确服从正态分布,从而支撑 t t t 检验和 F F F 检验的有限样本正确性。投资组合理论 :在均值-方差分析 (Mean-Variance Analysis) 中,若各资产收益率均服从正态分布且独立,则投资组合收益率作为各资产收益率的加权和也服从正态分布。这使得投资组合的风险价值 (VaR) 和期望损失 (ES) 可直接通过正态分位数计算。质量控制与 Six Sigma :制造过程中的多个独立随机误差源的叠加效应通常服从正态分布(部分由 CLT 保证),可加性确保了对部分工序进行线性调整后,输出特性仍可用正态模型描述。信号处理 :多个独立高斯噪声源叠加后仍为高斯噪声,这一事实简化了滤波器设计和检测理论中的似然比构造。
相关概念与对比
正态分布 :基础分布族,可加性是其最核心的代数封闭性质。中心极限定理 :为可加性的应用提供了为什么「现实中很多变量近似正态」的解释。卡方分布 :若 X i ∼ N ( 0 , 1 ) X_i \sim N(0, 1) X i ∼ N ( 0 , 1 ) 独立,则 ∑ X i 2 ∼ χ 2 ( n ) \sum X_i^2 \sim \chi^2(n) ∑ X i 2 ∼ χ 2 ( n ) ——这是正态分布平方的可加性(加性转移到自由度上)。伽马分布 :与正态不同,独立伽马变量之和仍为伽马,但要求尺度参数相同;正态分布的可加性则允许不同方差。柯西分布 :独立柯西变量之和仍为柯西,但均值取算术平均(而非加权和),且方差不适用(柯西分布方差不存在)。正态分布与柯西分布同属稳定分布 族,但正态是唯一具有有限方差的非退化稳定分布。
常见误区
一、误以为任何一元正态变量的线性组合都正态 :必须在独立或联合正态的条件下才成立。
二、将可加性与 CLT 混为一谈 :前者是精确结论,后者是渐近近似,两者的前提条件和结论性质均不同。
三、忽视方差恒为正的事实 :无论系数符号如何,方差公式 ∑ a i 2 σ i 2 \sum a_i^2 \sigma_i^2 ∑ a i 2 σ i 2 中的平方确保方差始终为正。特别地,X 1 − X 2 X_1 - X_2 X 1 − X 2 的方差为 σ 1 2 + σ 2 2 \sigma_1^2 + \sigma_2^2 σ 1 2 + σ 2 2 而非 σ 1 2 − σ 2 2 \sigma_1^2 - \sigma_2^2 σ 1 2 − σ 2 2 。