随机变量和的分布 (Distribution of the Sum of Random Variables)
在概率论 与统计学 中,研究多个随机变量 之和的概率分布 是一个核心且至关重要的问题。许多现实世界的现象都可以被建模为多个独立或相关随机因素的总和——例如,投资组合的总回报是其包含的各资产回报之和,测量中的总误差是多个独立误差源的累积,保险公司在一年内的总赔付是所有保单索赔额的总和,通信信号则是噪声与原始信号的叠加,而物理系统中大量微观粒子的集体行为则体现为宏观统计规律。因此,理解如何从单个随机变量的分布推导出它们和的分布,对于风险评估、模型构建和统计推断具有基础性的意义。这不仅是理论概率论的重要课题,也是计量经济学、金融工程、信号处理和精算科学等应用领域的基本工具。
给定一组随机变量 X 1 , X 2 , … , X n X_1, X_2, \dots, X_n X 1 , X 2 , … , X n 及其各自的概率分布,我们的目标是确定它们的和 S n = X 1 + X 2 + ⋯ + X n S_n = X_1 + X_2 + \dots + X_n S n = X 1 + X 2 + ⋯ + X n 的概率分布。解决这个问题的方法主要取决于这些随机变量之间是否具有独立性 (probability theory) 。
独立随机变量之和
当随机变量相互独立时,其和的分布计算相对简化。以下是几种常用的方法。
卷积 (Convolution)
卷积是计算两个独立随机变量和的分布最基本的数学工具,其具体形式根据变量是连续型还是离散型而有所不同。
对于连续型随机变量,设 X X X 和 Y Y Y 相互独立,其概率密度函数 分别为 f X ( x ) f_X(x) f X ( x ) 和 f Y ( y ) f_Y(y) f Y ( y ) ,则和 Z = X + Y Z = X + Y Z = X + Y 的累积分布函数为 F Z ( z ) = P ( X + Y ≤ z ) = ∬ x + y ≤ z f X ( x ) f Y ( y ) d x d y F_Z(z) = P(X+Y \le z) = \iint_{x+y \le z} f_X(x)f_Y(y)\,dx\,dy F Z ( z ) = P ( X + Y ≤ z ) = ∬ x + y ≤ z f X ( x ) f Y ( y ) d x d y 。由于 X X X 和 Y Y Y 独立,它们的联合概率分布 密度函数可分解为各自密度函数的乘积。对 F Z ( z ) F_Z(z) F Z ( z ) 求导可得 Z Z Z 的概率密度函数:
f Z ( z ) = d d z F Z ( z ) = ∫ − ∞ ∞ f X ( x ) f Y ( z − x ) d x f_Z(z) = \frac{d}{dz}F_Z(z) = \int_{-\infty}^{\infty} f_X(x) f_Y(z-x) \,dx f Z ( z ) = d z d F Z ( z ) = ∫ − ∞ ∞ f X ( x ) f Y ( z − x ) d x
该积分称为 f X f_X f X 与 f Y f_Y f Y 的卷积,记作 ( f X ∗ f Y ) ( z ) (f_X * f_Y)(z) ( f X ∗ f Y ) ( z ) 。由于对称性,也可写为 f Z ( z ) = ∫ − ∞ ∞ f Y ( y ) f X ( z − y ) d y f_Z(z) = \int_{-\infty}^{\infty} f_Y(y) f_X(z-y) \,dy f Z ( z ) = ∫ − ∞ ∞ f Y ( y ) f X ( z − y ) d y 。
对于离散型随机变量,设 X X X 和 Y Y Y 相互独立,其概率质量函数 分别为 p X ( x ) p_X(x) p X ( x ) 和 p Y ( y ) p_Y(y) p Y ( y ) ,则和 Z = X + Y Z = X + Y Z = X + Y 的概率质量函数为:
p Z ( z ) = P ( Z = z ) = ∑ k p X ( k ) p Y ( z − k ) p_Z(z) = P(Z = z) = \sum_{k} p_X(k) \, p_Y(z - k) p Z ( z ) = P ( Z = z ) = k ∑ p X ( k ) p Y ( z − k )
其中 k k k 取遍 X X X 所有可能的取值。卷积公式是推导和分布的理论基石,但在实际计算中有时较为繁琐。
生成函数法
尽管卷积提供了一种通用方法,但在许多常见分布中,使用生成函数的方法更为简便。其核心思想是:和的生成函数等于各独立变量生成函数的乘积。
矩生成函数 (MGF) 定义为 M X ( t ) = E [ e t X ] M_X(t) = E[e^{tX}] M X ( t ) = E [ e tX ] 。对于独立变量 X X X 和 Y Y Y ,有:
M X + Y ( t ) = E [ e t ( X + Y ) ] = E [ e t X e t Y ] = E [ e t X ] E [ e t Y ] = M X ( t ) M Y ( t ) M_{X+Y}(t) = E[e^{t(X+Y)}] = E[e^{tX}e^{tY}] = E[e^{tX}]E[e^{tY}] = M_X(t) M_Y(t) M X + Y ( t ) = E [ e t ( X + Y ) ] = E [ e tX e t Y ] = E [ e tX ] E [ e t Y ] = M X ( t ) M Y ( t )
该性质可推广至 n n n 个独立变量的和:M S n ( t ) = ∏ i = 1 n M X i ( t ) M_{S_n}(t) = \prod_{i=1}^n M_{X_i}(t) M S n ( t ) = ∏ i = 1 n M X i ( t ) 。通过计算出和的MGF,再对照已知分布的MGF表即可识别其分布,从而绕开复杂的卷积运算。
特征函数 定义为 ϕ X ( ω ) = E [ e i ω X ] \phi_X(\omega) = E[e^{i\omega X}] ϕ X ( ω ) = E [ e iω X ] ,其中 i i i 为虚数单位。它同样满足乘积性质:ϕ X + Y ( ω ) = ϕ X ( ω ) ϕ Y ( ω ) \phi_{X+Y}(\omega) = \phi_X(\omega)\phi_Y(\omega) ϕ X + Y ( ω ) = ϕ X ( ω ) ϕ Y ( ω ) 。与MGF相比,特征函数的主要优势在于它对任意随机变量都存在(MGF仅当期望收敛时才存在),因此在理论推导中更为常用,尤其是在中心极限定理 的证明中扮演着不可替代的角色。
具有可加性的分布族
某些概率分布族具有一个特殊性质——该族中独立随机变量的和仍然属于同一个分布族,仅参数发生相应变化。这一性质常被称为可加性或再生性。
正态分布 :若 X ∼ N ( μ X , σ X 2 ) X \sim N(\mu_X, \sigma_X^2) X ∼ N ( μ X , σ X 2 ) 和 Y ∼ N ( μ Y , σ Y 2 ) Y \sim N(\mu_Y, \sigma_Y^2) Y ∼ N ( μ Y , σ Y 2 ) 相互独立,则 X + Y ∼ N ( μ X + μ Y , σ X 2 + σ Y 2 ) X+Y \sim N(\mu_X+\mu_Y, \sigma_X^2+\sigma_Y^2) X + Y ∼ N ( μ X + μ Y , σ X 2 + σ Y 2 ) ,即均值和方差分别相加。泊松分布 :若 X ∼ Poisson ( λ 1 ) X \sim \text{Poisson}(\lambda_1) X ∼ Poisson ( λ 1 ) 和 Y ∼ Poisson ( λ 2 ) Y \sim \text{Poisson}(\lambda_2) Y ∼ Poisson ( λ 2 ) 相互独立,则 X + Y ∼ Poisson ( λ 1 + λ 2 ) X+Y \sim \text{Poisson}(\lambda_1+\lambda_2) X + Y ∼ Poisson ( λ 1 + λ 2 ) 。二项分布 :若 X ∼ B ( n 1 , p ) X \sim B(n_1, p) X ∼ B ( n 1 , p ) 和 Y ∼ B ( n 2 , p ) Y \sim B(n_2, p) Y ∼ B ( n 2 , p ) 相互独立(要求成功概率 p p p 相同),则 X + Y ∼ B ( n 1 + n 2 , p ) X+Y \sim B(n_1+n_2, p) X + Y ∼ B ( n 1 + n 2 , p ) 。伽玛分布 :若 X ∼ Gamma ( α 1 , β ) X \sim \text{Gamma}(\alpha_1, \beta) X ∼ Gamma ( α 1 , β ) 和 Y ∼ Gamma ( α 2 , β ) Y \sim \text{Gamma}(\alpha_2, \beta) Y ∼ Gamma ( α 2 , β ) 相互独立(要求率参数 β \beta β 相同),则 X + Y ∼ Gamma ( α 1 + α 2 , β ) X+Y \sim \text{Gamma}(\alpha_1+\alpha_2, \beta) X + Y ∼ Gamma ( α 1 + α 2 , β ) 。卡方分布 :作为伽玛分布的特例,若 X ∼ χ 2 ( k 1 ) X \sim \chi^2(k_1) X ∼ χ 2 ( k 1 ) 和 Y ∼ χ 2 ( k 2 ) Y \sim \chi^2(k_2) Y ∼ χ 2 ( k 2 ) 相互独立,则 X + Y ∼ χ 2 ( k 1 + k 2 ) X+Y \sim \chi^2(k_1+k_2) X + Y ∼ χ 2 ( k 1 + k 2 ) 。该性质是假设检验 中许多重要统计量分布的理论基础。
中心极限定理
对于大量随机变量求和的情形,中心极限定理 (CLT) 提供了一个极为强大且优美的近似结果。
CLT指出,若 X 1 , X 2 , … , X n X_1, X_2, \dots, X_n X 1 , X 2 , … , X n 是独立同分布 的随机变量,具有有限的均值 μ \mu μ 和方差 σ 2 \sigma^2 σ 2 ,则无论其原始分布为何种类型(如均匀分布 、指数分布 或伯努利分布 ),当样本量 n n n 足够大时,它们的和 S n S_n S n 的分布近似于正态分布。具体而言,S n S_n S n 近似服从 N ( n μ , n σ 2 ) N(n\mu, n\sigma^2) N ( n μ , n σ 2 ) ,其标准化形式 Z n = S n − n μ σ n Z_n = \frac{S_n - n\mu}{\sigma\sqrt{n}} Z n = σ n S n − n μ 依分布收敛于标准正态分布 N ( 0 , 1 ) N(0,1) N ( 0 , 1 ) 。
CLT是统计学乃至整个科学领域的基石之一,它解释了正态分布在自然界和测量中为何如此普遍存在,并为区间估计、假设检验和置信区间的构建提供了理论基础。值得注意的是,CLT对原始分布的具体形式要求很低(仅需存在有限的均值和方差),这使其成为推断统计中最为普适且强大的工具之一。在实际应用中,通常认为 n ≥ 30 n \geq 30 n ≥ 30 时近似效果已相当可靠,但具体所需的样本量依赖于原始分布的偏度和峰度。
相关随机变量之和
当随机变量之间存在相关性时,问题变得复杂得多。此时不能简单地将密度函数进行卷积或将MGF相乘,而必须依赖完整的联合概率分布 来刻画变量之间的依赖结构。例如,两个资产收益率往往在金融市场波动期间表现出正相关,此时仅知道各自的边际分布不足以计算投资组合总收益的分布。例如,对于两个相关的连续型随机变量 X X X 和 Y Y Y ,其和 Z = X + Y Z = X+Y Z = X + Y 的累积分布函数仍为:
F Z ( z ) = ∬ x + y ≤ z f X , Y ( x , y ) d x d y F_Z(z) = \iint_{x+y \le z} f_{X,Y}(x,y) \,dx\,dy F Z ( z ) = ∬ x + y ≤ z f X , Y ( x , y ) d x d y
但联合密度函数 f X , Y ( x , y ) f_{X,Y}(x,y) f X , Y ( x , y ) 已不能分解为边际密度函数的乘积,使计算难度显著增加。尽管如此,和的期望与方差仍有简洁的通用公式:
E [ X + Y ] = E [ X ] + E [ Y ] , V a r ( X + Y ) = V a r ( X ) + V a r ( Y ) + 2 C o v ( X , Y ) E[X+Y] = E[X] + E[Y], \quad Var(X+Y) = Var(X) + Var(Y) + 2Cov(X,Y) E [ X + Y ] = E [ X ] + E [ Y ] , Va r ( X + Y ) = Va r ( X ) + Va r ( Y ) + 2 C o v ( X , Y )
其中期望的线性性 对任意随机变量(无论是否独立)恒成立,而方差 公式中的 C o v ( X , Y ) Cov(X,Y) C o v ( X , Y ) 为协方差 。仅当 X X X 和 Y Y Y 不相关(协方差为零)时,方差公式才简化为 V a r ( X + Y ) = V a r ( X ) + V a r ( Y ) Var(X+Y) = Var(X) + Var(Y) Va r ( X + Y ) = Va r ( X ) + Va r ( Y ) 。