随机变量函数分布 (Distribution of Functions of Random Variables)
随机变量函数分布 是概率论 与数理统计 中的核心问题:已知随机变量 X X X 的概率分布,求其函数 Y = g ( X ) Y = g(X) Y = g ( X ) 的分布。这一问题贯穿统计推断的始终——从抽样分布 的推导到假设检验 中检验统计量的构造,几乎每一个统计方法都依赖于对随机变量函数的分布性质的掌握。常见的例子包括:样本均值的分布、样本方差的分布、t t t 统计量的分布、以及极大似然估计 量的渐近分布等。该问题的求解方法可大致分为三类:分布函数法 (CDF 方法)、变换法 (密度变换公式)和矩母函数法 (或其他生成函数法)。
问题的数学表述
设 X X X 为具有已知概率密度函数(PDF)f X ( x ) f_X(x) f X ( x ) 或累积分布函数(CDF)F X ( x ) F_X(x) F X ( x ) 的连续随机变量,g : R → R g: \mathbb{R} \to \mathbb{R} g : R → R 为可测函数。定义新随机变量:
目标是推导 Y Y Y 的分布——即求其累积分布函数 F Y ( y ) = P ( Y ≤ y ) = P ( g ( X ) ≤ y ) F_Y(y) = P(Y \leq y) = P(g(X) \leq y) F Y ( y ) = P ( Y ≤ y ) = P ( g ( X ) ≤ y ) ,进而求得密度函数 f Y ( y ) = d d y F Y ( y ) f_Y(y) = \frac{d}{dy} F_Y(y) f Y ( y ) = d y d F Y ( y ) 。问题的难度取决于函数 g g g 的性质(单调性、可微性、是否一一映射)以及 X X X 的维度。
分布函数法 (CDF Method)
分布函数法是最通用、最根本的方法,其思想直接来自概率的定义:
F Y ( y ) = P ( Y ≤ y ) = P ( g ( X ) ≤ y ) = P ( X ∈ { x : g ( x ) ≤ y } ) F_Y(y) = P(Y \leq y) = P(g(X) \leq y) = P(X \in \{x: g(x) \leq y\}) F Y ( y ) = P ( Y ≤ y ) = P ( g ( X ) ≤ y ) = P ( X ∈ { x : g ( x ) ≤ y })
通过求解不等式 g ( x ) ≤ y g(x) \leq y g ( x ) ≤ y 得到 x x x 的取值范围,然后利用 X X X 的已知分布计算概率。最后对 y y y 求导得 f Y ( y ) f_Y(y) f Y ( y ) 。
例 1(平方变换) :设 X ∼ N ( 0 , 1 ) X \sim N(0, 1) X ∼ N ( 0 , 1 ) ,求 Y = X 2 Y = X^2 Y = X 2 的分布。对 y ≥ 0 y \geq 0 y ≥ 0 :
F Y ( y ) = P ( X 2 ≤ y ) = P ( − y ≤ X ≤ y ) = Φ ( y ) − Φ ( − y ) = 2 Φ ( y ) − 1 F_Y(y) = P(X^2 \leq y) = P(-\sqrt{y} \leq X \leq \sqrt{y}) = \Phi(\sqrt{y}) - \Phi(-\sqrt{y}) = 2\Phi(\sqrt{y}) - 1 F Y ( y ) = P ( X 2 ≤ y ) = P ( − y ≤ X ≤ y ) = Φ ( y ) − Φ ( − y ) = 2Φ ( y ) − 1
求导得:
f Y ( y ) = 1 y ϕ ( y ) = 1 2 π y e − y / 2 , y > 0 f_Y(y) = \frac{1}{\sqrt{y}} \phi(\sqrt{y}) = \frac{1}{\sqrt{2\pi y}} e^{-y/2}, \quad y > 0 f Y ( y ) = y 1 ϕ ( y ) = 2 π y 1 e − y /2 , y > 0
这正是自由度为 1 的卡方分布 χ ( 1 ) 2 \chi^2_{(1)} χ ( 1 ) 2 的密度函数。该例揭示了卡方分布的本质来源:独立标准正态随机变量的平方和。
分布函数法的优点在于通用性 ——不要求 g g g 单调或一一映射,只需能够求解不等式 g ( x ) ≤ y g(x) \leq y g ( x ) ≤ y 的范围即可。其缺点是在复杂函数下,求解反函数和积分可能非常困难。
变换法 (Transformation Method)
当 g g g 是严格单调且可微的函数时,变换法提供了直接计算密度函数的简洁公式。
定理(一元变换) :设 X X X 为连续随机变量,支撑集为 X \mathcal{X} X ,g g g 在 X \mathcal{X} X 上严格单调且可微,反函数为 g − 1 g^{-1} g − 1 。则 Y = g ( X ) Y = g(X) Y = g ( X ) 的密度函数为:
f Y ( y ) = f X ( g − 1 ( y ) ) ⋅ ∣ d d y g − 1 ( y ) ∣ f_Y(y) = f_X(g^{-1}(y)) \cdot \left| \frac{d}{dy} g^{-1}(y) \right| f Y ( y ) = f X ( g − 1 ( y )) ⋅ d y d g − 1 ( y )
其中 ∣ d d y g − 1 ( y ) ∣ \bigl|\frac{d}{dy} g^{-1}(y)\bigr| d y d g − 1 ( y ) 称为雅可比项 (Jacobian),其绝对值反映了 X X X 空间到 Y Y Y 空间的尺度伸缩。
直觉解释 :概率在变换下守恒——∣ f X ( x ) d x ∣ = ∣ f Y ( y ) d y ∣ |f_X(x) dx| = |f_Y(y) dy| ∣ f X ( x ) d x ∣ = ∣ f Y ( y ) d y ∣ 。变换公式本质上是在应用"换元积分"的同时保持概率质量不变。雅可比项捕捉了 g g g 在局部对空间进行"拉伸"或"压缩"的程度:如果 g g g 在某点附近将 X X X 的一小段映射为 Y Y Y 的一大段,密度就会被稀释;反之则被浓缩。
例 2(指数变换) :设 X ∼ Uniform ( 0 , 1 ) X \sim \text{Uniform}(0, 1) X ∼ Uniform ( 0 , 1 ) ,求 Y = − ln X Y = -\ln X Y = − ln X 的分布。g ( x ) = − ln x g(x) = -\ln x g ( x ) = − ln x 在 ( 0 , 1 ) (0, 1) ( 0 , 1 ) 上严格递减,反函数 g − 1 ( y ) = e − y g^{-1}(y) = e^{-y} g − 1 ( y ) = e − y ,y > 0 y > 0 y > 0 。雅可比为 ∣ d d y e − y ∣ = e − y |\frac{d}{dy} e^{-y}| = e^{-y} ∣ d y d e − y ∣ = e − y 。于是:
f Y ( y ) = f X ( e − y ) ⋅ e − y = 1 ⋅ e − y = e − y , y > 0 f_Y(y) = f_X(e^{-y}) \cdot e^{-y} = 1 \cdot e^{-y} = e^{-y}, \quad y > 0 f Y ( y ) = f X ( e − y ) ⋅ e − y = 1 ⋅ e − y = e − y , y > 0
即 Y ∼ Exponential ( 1 ) Y \sim \text{Exponential}(1) Y ∼ Exponential ( 1 ) 。这个结果构成了生成指数分布随机数的逆变换采样法 (inverse transform sampling)的基础。
当 g g g 非单调时,可将定义域分割为单调子区间,分别应用变换公式后求和。
多元情形
设 X = ( X 1 , … , X n ) T \mathbf{X} = (X_1, \dots, X_n)^T X = ( X 1 , … , X n ) T 为连续随机向量,联合密度为 f X ( x ) f_{\mathbf{X}}(\mathbf{x}) f X ( x ) 。考虑向量值变换 Y = g ( X ) \mathbf{Y} = \mathbf{g}(\mathbf{X}) Y = g ( X ) ,其中 g : R n → R n \mathbf{g}: \mathbb{R}^n \to \mathbb{R}^n g : R n → R n 是一一映射且连续可微,反函数为 g − 1 \mathbf{g}^{-1} g − 1 。则 Y \mathbf{Y} Y 的联合密度为:
f Y ( y ) = f X ( g − 1 ( y ) ) ⋅ ∣ J ∣ f_{\mathbf{Y}}(\mathbf{y}) = f_{\mathbf{X}}(\mathbf{g}^{-1}(\mathbf{y})) \cdot |J| f Y ( y ) = f X ( g − 1 ( y )) ⋅ ∣ J ∣
其中 J = det ( ∂ x ∂ y ) = det ( ∂ g i − 1 ( y ) ∂ y j ) n × n J = \det\!\left(\frac{\partial \mathbf{x}}{\partial \mathbf{y}}\right) = \det\!\left(\frac{\partial g^{-1}_i(\mathbf{y})}{\partial y_j}\right)_{n \times n} J = det ( ∂ y ∂ x ) = det ( ∂ y j ∂ g i − 1 ( y ) ) n × n 为反变换的雅可比行列式 。
例 3(两个独立正态的线性组合) :设 X 1 , X 2 X_1, X_2 X 1 , X 2 独立且均服从 N ( 0 , 1 ) N(0,1) N ( 0 , 1 ) 。考虑正交变换:
Y 1 = X 1 + X 2 2 , Y 2 = X 1 − X 2 2 Y_1 = \frac{X_1 + X_2}{\sqrt{2}}, \quad Y_2 = \frac{X_1 - X_2}{\sqrt{2}} Y 1 = 2 X 1 + X 2 , Y 2 = 2 X 1 − X 2
该变换的雅可比行列式的绝对值为 1。联合密度为 f Y 1 , Y 2 ( y 1 , y 2 ) = 1 2 π e − ( y 1 2 + y 2 2 ) / 2 f_{Y_1, Y_2}(y_1, y_2) = \frac{1}{2\pi} e^{-(y_1^2 + y_2^2)/2} f Y 1 , Y 2 ( y 1 , y 2 ) = 2 π 1 e − ( y 1 2 + y 2 2 ) /2 ,表明 Y 1 Y_1 Y 1 与 Y 2 Y_2 Y 2 仍然是独立标准正态。这一性质是正态分布众多"封闭性"的核心来源。
当 Y \mathbf{Y} Y 的维度 m m m 小于 X \mathbf{X} X 的维度 n n n 时,通常采用"增补变量法":引入 n − m n-m n − m 个辅助变量使变换可逆,求得联合密度后对辅助变量积分(或求和)得到 Y \mathbf{Y} Y 的边际分布。卷积公式 本质上就是"求和函数 + 辅助变量"这一策略的结果:
f X 1 + X 2 ( z ) = ∫ − ∞ ∞ f X 1 ( x ) f X 2 ( z − x ) d x (当 X 1 , X 2 独立时) f_{X_1 + X_2}(z) = \int_{-\infty}^{\infty} f_{X_1}(x) f_{X_2}(z - x) \, dx \quad \text{(当 } X_1, X_2 \text{ 独立时)} f X 1 + X 2 ( z ) = ∫ − ∞ ∞ f X 1 ( x ) f X 2 ( z − x ) d x (当 X 1 , X 2 独立时)
矩母函数法 (MGF Method)
对于某些特定的函数形式——特别是独立随机变量的线性组合 ——矩母函数(MGF)提供了一个优雅的替代方法。其核心思想是利用 MGF 与分布的一一对应关系 (在 MGF 存在的邻域内):
M Y ( t ) = E [ e t Y ] = E [ e t g ( X ) ] M_Y(t) = E[e^{tY}] = E[e^{t g(X)}] M Y ( t ) = E [ e t Y ] = E [ e t g ( X ) ]
如果 M Y ( t ) M_Y(t) M Y ( t ) 可以被识别为某个已知分布的 MGF,则 Y Y Y 的分布就此确定,无需显式推导密度函数。这在对正态分布 、伽马分布 、泊松分布 等指数族分布的操作中尤为高效。
例 4(正态随机变量的线性组合) :设 X i ∼ N ( μ i , σ i 2 ) X_i \sim N(\mu_i, \sigma_i^2) X i ∼ N ( μ i , σ i 2 ) 独立,则 Y = ∑ a i X i Y = \sum a_i X_i Y = ∑ a i X i 的 MGF 为:
M Y ( t ) = ∏ i exp ( a i μ i t + 1 2 a i 2 σ i 2 t 2 ) = exp ( t ∑ a i μ i + 1 2 t 2 ∑ a i 2 σ i 2 ) M_Y(t) = \prod_i \exp\!\left( a_i \mu_i t + \frac{1}{2} a_i^2 \sigma_i^2 t^2 \right) = \exp\!\left( t \sum a_i \mu_i + \frac{1}{2} t^2 \sum a_i^2 \sigma_i^2 \right) M Y ( t ) = i ∏ exp ( a i μ i t + 2 1 a i 2 σ i 2 t 2 ) = exp ( t ∑ a i μ i + 2 1 t 2 ∑ a i 2 σ i 2 )
这是 N ( ∑ a i μ i , ∑ a i 2 σ i 2 ) N(\sum a_i \mu_i, \sum a_i^2 \sigma_i^2) N ( ∑ a i μ i , ∑ a i 2 σ i 2 ) 的 MGF,从而立即得到 Y Y Y 仍服从正态分布。该结论是最小二乘法 和线性模型 理论的重要基石。
MGF 法的局限在于并非所有分布都具有有限的 MGF(例如柯西分布 ),且识别 MGF 可能并不总是直观。此时可退而求助于特征函数 (characteristic function),它始终存在且与分布一一对应。
在统计推断中的应用
随机变量函数分布的理论构成了以下关键统计方法的基础:
抽样分布理论 :X ˉ = 1 n ∑ X i \bar{X} = \frac{1}{n} \sum X_i X ˉ = n 1 ∑ X i 的分布、S 2 = 1 n − 1 ∑ ( X i − X ˉ ) 2 S^2 = \frac{1}{n-1} \sum (X_i - \bar{X})^2 S 2 = n − 1 1 ∑ ( X i − X ˉ ) 2 的分布、以及 X ˉ − μ S / n ∼ t ( n − 1 ) \frac{\bar{X} - \mu}{S/\sqrt{n}} \sim t_{(n-1)} S / n X ˉ − μ ∼ t ( n − 1 ) 的推导,全部依赖于对正态随机变量各种函数(和、平方和、比值)的分布求解。Delta 方法 :当 g g g 光滑且 θ ^ n \hat{\theta}_n θ ^ n 满足 n ( θ ^ n − θ ) → d N ( 0 , σ 2 ) \sqrt{n}(\hat{\theta}_n - \theta) \xrightarrow{d} N(0, \sigma^2) n ( θ ^ n − θ ) d N ( 0 , σ 2 ) 时,利用一阶 Taylor 展开: \[ \sqrt{n}(g(\hat{\theta}_n) - g(\theta)) \xrightarrow{d} N\!\left(0, [g'(\theta)]^2 \sigma^2\right) \] 这本质上是非线性变换下渐近分布的近似求解,广泛用于极大似然估计 的标准误差计算。概率积分变换 :若 X X X 具有连续 CDF F X F_X F X ,则 Y = F X ( X ) ∼ Uniform ( 0 , 1 ) Y = F_X(X) \sim \text{Uniform}(0, 1) Y = F X ( X ) ∼ Uniform ( 0 , 1 ) 。这一优雅结论是Copula 建模和拟合优度检验中 p p p 值理论的基础——无论原始分布为何,只要模型正确,p p p 值总是均匀分布。
方法论总结
三种方法的适用场景各有侧重:分布函数法 适合任意可测函数,是一般性的"蛮力"方法;变换法 适合光滑单调函数及多元一一变换,提供了最直接的密度解析式;矩母函数法 在独立随机变量线性组合、卷积和渐近期望计算中最为简洁。实际应用中,研究者通常根据 g g g 的形式灵活选择或组合使用这些工具。掌握随机变量函数分布的推导技术,是从概率论学习者转变为统计应用者的关键一步。