知经百科 / S

随机变量函数分布

随机变量函数分布 (Distribution of Functions of Random Variables)

随机变量函数分布概率论数理统计中的核心问题:已知随机变量 X X 的概率分布,求其函数 Y=g(X) Y = g(X) 的分布。这一问题贯穿统计推断的始终——从抽样分布的推导到假设检验中检验统计量的构造,几乎每一个统计方法都依赖于对随机变量函数的分布性质的掌握。常见的例子包括:样本均值的分布、样本方差的分布、t t 统计量的分布、以及极大似然估计量的渐近分布等。该问题的求解方法可大致分为三类:分布函数法(CDF 方法)、变换法(密度变换公式)和矩母函数法(或其他生成函数法)。

问题的数学表述

X X 为具有已知概率密度函数(PDF)fX(x) f_X(x) 或累积分布函数(CDF)FX(x) F_X(x) 的连续随机变量,g:RR g: \mathbb{R} \to \mathbb{R} 为可测函数。定义新随机变量:

Y=g(X)Y = g(X)

目标是推导 Y Y 的分布——即求其累积分布函数 FY(y)=P(Yy)=P(g(X)y) F_Y(y) = P(Y \leq y) = P(g(X) \leq y) ,进而求得密度函数 fY(y)=ddyFY(y) f_Y(y) = \frac{d}{dy} F_Y(y) 。问题的难度取决于函数 g g 的性质(单调性、可微性、是否一一映射)以及 X X 的维度。

分布函数法 (CDF Method)

分布函数法是最通用、最根本的方法,其思想直接来自概率的定义:

FY(y)=P(Yy)=P(g(X)y)=P(X{x:g(x)y})F_Y(y) = P(Y \leq y) = P(g(X) \leq y) = P(X \in \{x: g(x) \leq y\})

通过求解不等式 g(x)y g(x) \leq y 得到 x x 的取值范围,然后利用 X X 的已知分布计算概率。最后对 y y 求导得 fY(y) f_Y(y)

例 1(平方变换):设 XN(0,1) X \sim N(0, 1) ,求 Y=X2 Y = X^2 的分布。对 y0 y \geq 0

FY(y)=P(X2y)=P(yXy)=Φ(y)Φ(y)=2Φ(y)1F_Y(y) = P(X^2 \leq y) = P(-\sqrt{y} \leq X \leq \sqrt{y}) = \Phi(\sqrt{y}) - \Phi(-\sqrt{y}) = 2\Phi(\sqrt{y}) - 1

求导得:

fY(y)=1yϕ(y)=12πyey/2,y>0f_Y(y) = \frac{1}{\sqrt{y}} \phi(\sqrt{y}) = \frac{1}{\sqrt{2\pi y}} e^{-y/2}, \quad y > 0

这正是自由度为 1 的卡方分布 χ(1)2 \chi^2_{(1)} 的密度函数。该例揭示了卡方分布的本质来源:独立标准正态随机变量的平方和。

分布函数法的优点在于通用性——不要求 g g 单调或一一映射,只需能够求解不等式 g(x)y g(x) \leq y 的范围即可。其缺点是在复杂函数下,求解反函数和积分可能非常困难。

变换法 (Transformation Method)

g g 是严格单调且可微的函数时,变换法提供了直接计算密度函数的简洁公式。

定理(一元变换):设 X X 为连续随机变量,支撑集为 X \mathcal{X} g g X \mathcal{X} 上严格单调且可微,反函数为 g1 g^{-1} 。则 Y=g(X) Y = g(X) 的密度函数为:

fY(y)=fX(g1(y))ddyg1(y)f_Y(y) = f_X(g^{-1}(y)) \cdot \left| \frac{d}{dy} g^{-1}(y) \right|

其中 ddyg1(y) \bigl|\frac{d}{dy} g^{-1}(y)\bigr| 称为雅可比项(Jacobian),其绝对值反映了 X X 空间到 Y Y 空间的尺度伸缩。

直觉解释:概率在变换下守恒——fX(x)dx=fY(y)dy |f_X(x) dx| = |f_Y(y) dy| 。变换公式本质上是在应用"换元积分"的同时保持概率质量不变。雅可比项捕捉了 g g 在局部对空间进行"拉伸"或"压缩"的程度:如果 g g 在某点附近将 X X 的一小段映射为 Y Y 的一大段,密度就会被稀释;反之则被浓缩。

例 2(指数变换):设 XUniform(0,1) X \sim \text{Uniform}(0, 1) ,求 Y=lnX Y = -\ln X 的分布。g(x)=lnx g(x) = -\ln x (0,1) (0, 1) 上严格递减,反函数 g1(y)=ey g^{-1}(y) = e^{-y} y>0 y > 0 。雅可比为 ddyey=ey |\frac{d}{dy} e^{-y}| = e^{-y} 。于是:

fY(y)=fX(ey)ey=1ey=ey,y>0f_Y(y) = f_X(e^{-y}) \cdot e^{-y} = 1 \cdot e^{-y} = e^{-y}, \quad y > 0

YExponential(1) Y \sim \text{Exponential}(1) 。这个结果构成了生成指数分布随机数的逆变换采样法(inverse transform sampling)的基础。

g g 非单调时,可将定义域分割为单调子区间,分别应用变换公式后求和。

多元情形

X=(X1,,Xn)T \mathbf{X} = (X_1, \dots, X_n)^T 为连续随机向量,联合密度为 fX(x) f_{\mathbf{X}}(\mathbf{x}) 。考虑向量值变换 Y=g(X) \mathbf{Y} = \mathbf{g}(\mathbf{X}) ,其中 g:RnRn \mathbf{g}: \mathbb{R}^n \to \mathbb{R}^n 是一一映射且连续可微,反函数为 g1 \mathbf{g}^{-1} 。则 Y \mathbf{Y} 的联合密度为:

fY(y)=fX(g1(y))Jf_{\mathbf{Y}}(\mathbf{y}) = f_{\mathbf{X}}(\mathbf{g}^{-1}(\mathbf{y})) \cdot |J|

其中 J=det ⁣(xy)=det ⁣(gi1(y)yj)n×n J = \det\!\left(\frac{\partial \mathbf{x}}{\partial \mathbf{y}}\right) = \det\!\left(\frac{\partial g^{-1}_i(\mathbf{y})}{\partial y_j}\right)_{n \times n} 为反变换的雅可比行列式

例 3(两个独立正态的线性组合):设 X1,X2 X_1, X_2 独立且均服从 N(0,1) N(0,1) 。考虑正交变换:

Y1=X1+X22,Y2=X1X22Y_1 = \frac{X_1 + X_2}{\sqrt{2}}, \quad Y_2 = \frac{X_1 - X_2}{\sqrt{2}}

该变换的雅可比行列式的绝对值为 1。联合密度为 fY1,Y2(y1,y2)=12πe(y12+y22)/2 f_{Y_1, Y_2}(y_1, y_2) = \frac{1}{2\pi} e^{-(y_1^2 + y_2^2)/2} ,表明 Y1 Y_1 Y2 Y_2 仍然是独立标准正态。这一性质是正态分布众多"封闭性"的核心来源。

Y \mathbf{Y} 的维度 m m 小于 X \mathbf{X} 的维度 n n 时,通常采用"增补变量法":引入 nm n-m 个辅助变量使变换可逆,求得联合密度后对辅助变量积分(或求和)得到 Y \mathbf{Y} 的边际分布。卷积公式本质上就是"求和函数 + 辅助变量"这一策略的结果:

fX1+X2(z)=fX1(x)fX2(zx)dx(当 X1,X2 独立时)f_{X_1 + X_2}(z) = \int_{-\infty}^{\infty} f_{X_1}(x) f_{X_2}(z - x) \, dx \quad \text{(当 } X_1, X_2 \text{ 独立时)}

矩母函数法 (MGF Method)

对于某些特定的函数形式——特别是独立随机变量的线性组合——矩母函数(MGF)提供了一个优雅的替代方法。其核心思想是利用 MGF 与分布的一一对应关系(在 MGF 存在的邻域内):

MY(t)=E[etY]=E[etg(X)]M_Y(t) = E[e^{tY}] = E[e^{t g(X)}]

如果 MY(t) M_Y(t) 可以被识别为某个已知分布的 MGF,则 Y Y 的分布就此确定,无需显式推导密度函数。这在对正态分布伽马分布泊松分布等指数族分布的操作中尤为高效。

例 4(正态随机变量的线性组合):设 XiN(μi,σi2) X_i \sim N(\mu_i, \sigma_i^2) 独立,则 Y=aiXi Y = \sum a_i X_i 的 MGF 为:

MY(t)=iexp ⁣(aiμit+12ai2σi2t2)=exp ⁣(taiμi+12t2ai2σi2)M_Y(t) = \prod_i \exp\!\left( a_i \mu_i t + \frac{1}{2} a_i^2 \sigma_i^2 t^2 \right) = \exp\!\left( t \sum a_i \mu_i + \frac{1}{2} t^2 \sum a_i^2 \sigma_i^2 \right)

这是 N(aiμi,ai2σi2) N(\sum a_i \mu_i, \sum a_i^2 \sigma_i^2) 的 MGF,从而立即得到 Y Y 仍服从正态分布。该结论是最小二乘法线性模型理论的重要基石。

MGF 法的局限在于并非所有分布都具有有限的 MGF(例如柯西分布),且识别 MGF 可能并不总是直观。此时可退而求助于特征函数(characteristic function),它始终存在且与分布一一对应。

在统计推断中的应用

随机变量函数分布的理论构成了以下关键统计方法的基础:

  • 抽样分布理论Xˉ=1nXi \bar{X} = \frac{1}{n} \sum X_i 的分布、S2=1n1(XiXˉ)2 S^2 = \frac{1}{n-1} \sum (X_i - \bar{X})^2 的分布、以及 XˉμS/nt(n1) \frac{\bar{X} - \mu}{S/\sqrt{n}} \sim t_{(n-1)} 的推导,全部依赖于对正态随机变量各种函数(和、平方和、比值)的分布求解。
  • Delta 方法:当 g g 光滑且 θ^n \hat{\theta}_n 满足 n(θ^nθ)dN(0,σ2) \sqrt{n}(\hat{\theta}_n - \theta) \xrightarrow{d} N(0, \sigma^2) 时,利用一阶 Taylor 展开: \[ \sqrt{n}(g(\hat{\theta}_n) - g(\theta)) \xrightarrow{d} N\!\left(0, [g'(\theta)]^2 \sigma^2\right) \] 这本质上是非线性变换下渐近分布的近似求解,广泛用于极大似然估计的标准误差计算。
  • 概率积分变换:若 X X 具有连续 CDF FX F_X ,则 Y=FX(X)Uniform(0,1) Y = F_X(X) \sim \text{Uniform}(0, 1) 。这一优雅结论是Copula建模和拟合优度检验中 p p 值理论的基础——无论原始分布为何,只要模型正确,p p 值总是均匀分布。

方法论总结

三种方法的适用场景各有侧重:分布函数法适合任意可测函数,是一般性的"蛮力"方法;变换法适合光滑单调函数及多元一一变换,提供了最直接的密度解析式;矩母函数法在独立随机变量线性组合、卷积和渐近期望计算中最为简洁。实际应用中,研究者通常根据 g g 的形式灵活选择或组合使用这些工具。掌握随机变量函数分布的推导技术,是从概率论学习者转变为统计应用者的关键一步。

返回百科索引