知经百科 / S

随机变量函数的分布

随机变量函数的分布 (Distribution of a Function of a Random Variable)

概率论统计学中,一个核心问题是:如果我们已知一个或多个随机变量概率分布,那么由这些随机变量构成的函数的分布是什么?这个问题构成了许多统计推断理论的基石,例如推导统计量的抽样分布。

一个随机变量的函数本身也是一个随机变量。假设 X X 是一个随机变量,而 g g 是一个实值函数,那么 Y=g(X) Y = g(X) 就是一个新的随机变量。我们的目标是,在已知 X X 的分布(例如其概率质量函数 (PMF) 或概率密度函数 (PDF))的情况下,求出 Y Y 的分布。

解决这个问题的方法主要取决于原始随机变量 X X 是离散的还是连续的。

离散随机变量的函数分布

X X 是一个离散随机变量时,其函数 Y=g(X) Y = g(X) 的分布求解相对直接。

假设 X X 的所有可能取值为 x1,x2, x_1, x_2, \dots ,其对应的概率质量函数 (PMF) 为 pX(xi)=P(X=xi) p_X(x_i) = P(X = x_i) 。由于 X X 的取值是离散的,其函数 Y=g(X) Y = g(X) 的可能取值 yj=g(xi) y_j = g(x_i) 也必然是一个可数集合,因此 Y Y 也是一个离散随机变量。

为了求得 Y Y 的 PMF pY(y) p_Y(y) ,我们需要找到所有使得 g(X)=y g(X) = y X X 的值,并将它们对应的概率相加。其计算公式为:

pY(y)=P(Y=y)=P(g(X)=y)=xi:g(xi)=yP(X=xi)=xi:g(xi)=ypX(xi)p_Y(y) = P(Y = y) = P(g(X) = y) = \sum_{x_i: g(x_i)=y} P(X = x_i) = \sum_{x_i: g(x_i)=y} p_X(x_i)

示例:

假设随机变量 X X 的 PMF 如下:

P(X=2)=0.1,P(X=1)=0.3,P(X=1)=0.4,P(X=2)=0.2P(X = -2) = 0.1, \quad P(X = -1) = 0.3, \quad P(X = 1) = 0.4, \quad P(X = 2) = 0.2

Y=X2 Y = X^2 。我们来求 Y Y 的 PMF。

  1. 确定 Y Y 的可能取值

X X 的取值为 {2,1,1,2} \{-2, -1, 1, 2\} ,因此 Y=X2 Y = X^2 的可能取值是 {(2)2,(1)2,12,22}={4,1} \{(-2)^2, (-1)^2, 1^2, 2^2\} = \{4, 1\}

  1. 计算每个取值的概率
  • 对于 y=1 y=1

P(Y=1)=P(X2=1)=P(X=1 or X=1) P(Y = 1) = P(X^2 = 1) = P(X = -1 \text{ or } X = 1) 。 由于事件 {X=1} \{X=-1\} {X=1} \{X=1\} 是互斥的,我们可以直接将它们的概率相加: P(Y=1)=P(X=1)+P(X=1)=0.3+0.4=0.7 P(Y = 1) = P(X = -1) + P(X = 1) = 0.3 + 0.4 = 0.7

  • 对于 y=4 y=4

P(Y=4)=P(X2=4)=P(X=2 or X=2) P(Y = 4) = P(X^2 = 4) = P(X = -2 \text{ or } X = 2) P(Y=4)=P(X=2)+P(X=2)=0.1+0.2=0.3 P(Y = 4) = P(X = -2) + P(X = 2) = 0.1 + 0.2 = 0.3

  1. 得到 Y Y 的 PMF
pY(1)=0.7,pY(4)=0.3p_Y(1) = 0.7, \quad p_Y(4) = 0.3

我们可以验证所有概率之和为 0.7+0.3=1 0.7 + 0.3 = 1

连续随机变量的函数分布

X X 是一个连续随机变量时,求解其函数 Y=g(X) Y=g(X) 的分布会更复杂。主要有两种常用方法:分布函数法变量替换法

方法一:分布函数法 (The CDF Method)

这是最基本、最通用的方法,适用于任何类型的函数 g(x) g(x) (包括非单调函数)。其核心思想是先求出 Y Y 累积分布函数 (CDF) FY(y) F_Y(y) ,然后通过对 CDF 求导得到其概率密度函数 (PDF) fY(y) f_Y(y)

步骤如下:

  1. 写出 Y Y 的 CDF 定义FY(y)=P(Yy) F_Y(y) = P(Y \le y)
  2. X X 替换 Y Y FY(y)=P(g(X)y) F_Y(y) = P(g(X) \le y)
  3. 解不等式:对不等式 g(X)y g(X) \le y 求解,将其转化为关于 X X 的一个或多个区间。这是此方法中最关键的一步。
  4. 计算概率:利用 X X 的 CDF, FX(x) F_X(x) , 或 PDF, fX(x) f_X(x) , 计算上一步得到的关于 X X 的区间的概率。
  5. 求导得到 PDF:对 FY(y) F_Y(y) 关于 y y 求导,得到 Y Y 的 PDF:fY(y)=ddyFY(y) f_Y(y) = \frac{d}{dy}F_Y(y)

示例:

假设 X X 服从参数为 λ \lambda 指数分布 (Exponential Distribution),其 PDF 为 fX(x)=λeλx f_X(x) = \lambda e^{-\lambda x} for x>0 x > 0 。令 Y=X Y = \sqrt{X} ,求 Y Y 的分布。

  1. Y Y 的 CDFFY(y)=P(Yy) F_Y(y) = P(Y \le y)

首先确定 Y Y 的取值范围。由于 X>0 X > 0 ,因此 Y=X>0 Y = \sqrt{X} > 0 。对于 y0 y \le 0 FY(y)=0 F_Y(y) = 0 。我们只考虑 y>0 y > 0 的情况。

  1. X X 替换 Y Y FY(y)=P(Xy) F_Y(y) = P(\sqrt{X} \le y) for y>0 y > 0
  1. 解不等式Xy    0<Xy2 \sqrt{X} \le y \implies 0 < X \le y^2
  1. 计算概率
FY(y)=P(0<Xy2)=0y2fX(x)dx=0y2λeλxdxF_Y(y) = P(0 < X \le y^2) = \int_0^{y^2} f_X(x) dx = \int_0^{y^2} \lambda e^{-\lambda x} dx
FY(y)=[eλx]0y2=eλy2(e0)=1eλy2F_Y(y) = [-e^{-\lambda x}]_0^{y^2} = -e^{-\lambda y^2} - (-e^0) = 1 - e^{-\lambda y^2}

所以,Y Y 的 CDF 为:

FY(y)={1eλy2if y>00if y0F_Y(y) = \begin{cases} 1 - e^{-\lambda y^2} & \text{if } y > 0 \\ 0 & \text{if } y \le 0 \end{cases}
  1. 求导得到 PDF

对于 y>0 y > 0

fY(y)=ddy(1eλy2)=eλy2(2λy)=2λyeλy2f_Y(y) = \frac{d}{dy} (1 - e^{-\lambda y^2}) = -e^{-\lambda y^2} \cdot (-2\lambda y) = 2\lambda y e^{-\lambda y^2}

因此, Y Y 的 PDF 为:

fY(y)={2λyeλy2if y>00if y0f_Y(y) = \begin{cases} 2\lambda y e^{-\lambda y^2} & \text{if } y > 0 \\ 0 & \text{if } y \le 0 \end{cases}

这被称为瑞利分布 (Rayleigh distribution)。

方法二:变量替换法 (The Change of Variable Formula)

这是一种更直接的计算 PDF 的方法,但它要求函数 y=g(x) y=g(x) 是严格单调的(严格递增或严格递减)并且可微。

假设 y=g(x) y = g(x) 是一个严格单调函数,那么它存在唯一的反函数 x=g1(y)=h(y) x = g^{-1}(y) = h(y) Y Y 的 PDF 可以通过以下公式直接得到:

fY(y)=fX(h(y))dh(y)dyf_Y(y) = f_X(h(y)) \cdot \left| \frac{dh(y)}{dy} \right|

这里的 dh(y)dy \left| \frac{dh(y)}{dy} \right| 是反函数导数的绝对值,它在多维情况下推广为雅可比行列式 (Jacobian)的绝对值。这个因子是必需的,因为它保证了变换后总概率仍然积分为1。

当函数不是单调时: 如果 g(x) g(x) 不是单调的,例如 Y=X2 Y = X^2 ,我们可以将 X X 的定义域划分为多个区间,使 g(x) g(x) 在每个区间上都是单调的。然后,对每个区间应用变量替换法,并将结果相加。

若对于一个 y y 值,有 k k 个解 x1,x2,,xk x_1, x_2, \dots, x_k 使得 g(xi)=y g(x_i) = y ,那么 Y Y 的 PDF 是每一部分贡献的总和:

fY(y)=i=1kfX(hi(y))dhi(y)dyf_Y(y) = \sum_{i=1}^k f_X(h_i(y)) \cdot \left| \frac{dh_i(y)}{dy} \right|

其中 xi=hi(y) x_i = h_i(y) 是第 i i 个反函数。

示例:

假设 X X 服从标准正态分布 N(0,1) N(0, 1) ,其 PDF 为 fX(x)=12πex2/2 f_X(x) = \frac{1}{\sqrt{2\pi}} e^{-x^2/2} 。令 Y=X2 Y = X^2 ,求 Y Y 的分布。

  1. 分析函数和反函数

函数 g(x)=x2 g(x) = x^2 不是单调的。对于任意 y>0 y > 0 ,有两个 x x 值与之对应:x1=y x_1 = -\sqrt{y} (当 x<0 x < 0 时) 和 x2=y x_2 = \sqrt{y} (当 x>0 x > 0 时)。 我们有两个反函数:

  • x1=h1(y)=y x_1 = h_1(y) = -\sqrt{y} ,其导数为 h1(y)=12y h_1'(y) = -\frac{1}{2\sqrt{y}}
  • x2=h2(y)=y x_2 = h_2(y) = \sqrt{y} ,其导数为 h2(y)=12y h_2'(y) = \frac{1}{2\sqrt{y}}
  1. 应用多对一公式
fY(y)=fX(h1(y))h1(y)+fX(h2(y))h2(y)f_Y(y) = f_X(h_1(y)) \cdot |h_1'(y)| + f_X(h_2(y)) \cdot |h_2'(y)|

代入 fX(x) f_X(x) 的表达式:

fY(y)=12πe(y)2/212y+12πe(y)2/212yf_Y(y) = \frac{1}{\sqrt{2\pi}} e^{-(-\sqrt{y})^2/2} \cdot \left|-\frac{1}{2\sqrt{y}}\right| + \frac{1}{\sqrt{2\pi}} e^{-(\sqrt{y})^2/2} \cdot \left|\frac{1}{2\sqrt{y}}\right|

对于 y>0 y > 0

fY(y)=12πey/212y+12πey/212yf_Y(y) = \frac{1}{\sqrt{2\pi}} e^{-y/2} \cdot \frac{1}{2\sqrt{y}} + \frac{1}{\sqrt{2\pi}} e^{-y/2} \cdot \frac{1}{2\sqrt{y}}
fY(y)=212πey/212y=12πyey/2f_Y(y) = 2 \cdot \frac{1}{\sqrt{2\pi}} e^{-y/2} \cdot \frac{1}{2\sqrt{y}} = \frac{1}{\sqrt{2\pi y}} e^{-y/2}
  1. 结论

Y=X2 Y=X^2 的 PDF 为 fY(y)=12πyey/2 f_Y(y) = \frac{1}{\sqrt{2\pi y}} e^{-y/2} for y>0 y > 0 。这正是自由度为1的卡方分布 (χ2(1) \chi^2(1) ) 的 PDF。这个结果在假设检验理论中至关重要。

多变量函数的推广

上述方法可以自然地推广到多个随机变量的函数情形。设 X1,X2,,Xn X_1, X_2, \dots, X_n n n 个随机变量,其联合分布已知,我们需要求出 Z=g(X1,X2,,Xn) Z = g(X_1, X_2, \dots, X_n) 的分布。

和的分布与卷积

Z=X+Y Z = X + Y X X Y Y 相互独立时,Z Z 的分布可通过卷积公式求得。对于连续随机变量,Z Z 的 PDF 为:

fZ(z)=fX(x)fY(zx)dxf_Z(z) = \int_{-\infty}^{\infty} f_X(x) f_Y(z - x) dx

对于离散随机变量,Z Z 的 PMF 为:

pZ(z)=xpX(x)pY(zx)p_Z(z) = \sum_{x} p_X(x) p_Y(z - x)

卷积运算在信号处理、时间序列分析金融经济学中有广泛应用。例如,独立同分布随机变量之和的分布可以通过反复卷积得到,这为中心极限定理提供了直观的数值验证途径。

商的分布

对于 Z=X/Y Z = X/Y ,其中 X X Y Y 是相互独立的连续随机变量,Z Z 的分布可通过联合分布雅可比变换推导得出:

fZ(z)=yfX(zy)fY(y)dyf_Z(z) = \int_{-\infty}^{\infty} |y| f_X(zy) f_Y(y) dy

一个重要的特例是:当 XN(0,1) X \sim N(0,1) Yχ2(n) Y \sim \chi^2(n) 时,T=X/Y/n T = X/\sqrt{Y/n} 服从自由度 n n 的{}t-分布{},这是小样本统计推断的核心工具。

极值分布

在实际问题中,我们经常关心一组随机变量中的最大值或最小值。设 X1,X2,,Xn X_1, X_2, \dots, X_n 为独立同分布的随机变量,令 Mn=max{X1,,Xn} M_n = \max\{X_1, \dots, X_n\} Mn M_n 的分布函数为:

FMn(x)=P(Mnx)=P(X1x,,Xnx)=[FX(x)]nF_{M_n}(x) = P(M_n \le x) = P(X_1 \le x, \dots, X_n \le x) = [F_X(x)]^n

类似地,最小值 mn=min{X1,,Xn} m_n = \min\{X_1, \dots, X_n\} 的分布函数为:

Fmn(x)=1P(mn>x)=1[1FX(x)]nF_{m_n}(x) = 1 - P(m_n > x) = 1 - [1 - F_X(x)]^n

极值分布理论在气象学工程可靠性风险管理中具有重要应用。极值理论进一步指出,经过适当标准化后的 Mn M_n 收敛于广义极值分布,这一结论类似于中心极限定理对均值的收敛性。

数值方法与计算工具

当函数的解析形式过于复杂或不存在闭式解时,数值方法成为必要手段。

蒙特卡洛模拟是最通用的数值方法之一。其基本思路是:从 X X 的已知分布中抽取大量独立样本 x(1),x(2),,x(M) x^{(1)}, x^{(2)}, \dots, x^{(M)} ,然后计算 y(i)=g(x(i)) y^{(i)} = g(x^{(i)}) ,最后通过直方图核密度估计来近似 Y Y 的分布。随着样本量 M M 的增大,蒙特卡洛估计依概率收敛于真实分布。这一方法不需要对 g g 施加任何单调性或可微性假设,因此适用于极其复杂的函数变换。

矩生成函数特征函数提供了另一类强大的解析工具。对于随机变量的独立和,矩生成函数满足 MX+Y(t)=MX(t)MY(t) M_{X+Y}(t) = M_X(t) M_Y(t) ,而特征函数满足 ϕX+Y(t)=ϕX(t)ϕY(t) \phi_{X+Y}(t) = \phi_X(t) \phi_Y(t) 。这一乘积性质使得求和运算在变换域中大大简化,再通过反变换即可得到分布的具体形式。

应用领域

随机变量函数的分布在以下领域具有核心地位:

返回百科索引