随机变量函数的分布 (Distribution of a Function of a Random Variable)
在概率论 和统计学 中,一个核心问题是:如果我们已知一个或多个随机变量 的概率分布 ,那么由这些随机变量构成的函数的分布是什么?这个问题构成了许多统计推断理论的基石,例如推导统计量 的抽样分布。
一个随机变量的函数 本身也是一个随机变量。假设 X X X 是一个随机变量,而 g g g 是一个实值函数,那么 Y = g ( X ) Y = g(X) Y = g ( X ) 就是一个新的随机变量。我们的目标是,在已知 X X X 的分布(例如其概率质量函数 (PMF) 或概率密度函数 (PDF))的情况下,求出 Y Y Y 的分布。
解决这个问题的方法主要取决于原始随机变量 X X X 是离散的还是连续的。
离散随机变量的函数分布
当 X X X 是一个离散随机变量 时,其函数 Y = g ( X ) Y = g(X) Y = g ( X ) 的分布求解相对直接。
假设 X X X 的所有可能取值为 x 1 , x 2 , … x_1, x_2, \dots x 1 , x 2 , … ,其对应的概率质量函数 (PMF) 为 p X ( x i ) = P ( X = x i ) p_X(x_i) = P(X = x_i) p X ( x i ) = P ( X = x i ) 。由于 X X X 的取值是离散的,其函数 Y = g ( X ) Y = g(X) Y = g ( X ) 的可能取值 y j = g ( x i ) y_j = g(x_i) y j = g ( x i ) 也必然是一个可数集合,因此 Y Y Y 也是一个离散随机变量。
为了求得 Y Y Y 的 PMF p Y ( y ) p_Y(y) p Y ( y ) ,我们需要找到所有使得 g ( X ) = y g(X) = y g ( X ) = y 的 X X X 的值,并将它们对应的概率相加。其计算公式为:
p Y ( y ) = P ( Y = y ) = P ( g ( X ) = y ) = ∑ x i : g ( x i ) = y P ( X = x i ) = ∑ x i : g ( x i ) = y p X ( x i ) p_Y(y) = P(Y = y) = P(g(X) = y) = \sum_{x_i: g(x_i)=y} P(X = x_i) = \sum_{x_i: g(x_i)=y} p_X(x_i) p Y ( y ) = P ( Y = y ) = P ( g ( X ) = y ) = x i : g ( x i ) = y ∑ P ( X = x i ) = x i : g ( x i ) = y ∑ p X ( x i )
示例:
假设随机变量 X X X 的 PMF 如下:
P ( X = − 2 ) = 0.1 , P ( X = − 1 ) = 0.3 , P ( X = 1 ) = 0.4 , P ( X = 2 ) = 0.2 P(X = -2) = 0.1, \quad P(X = -1) = 0.3, \quad P(X = 1) = 0.4, \quad P(X = 2) = 0.2 P ( X = − 2 ) = 0.1 , P ( X = − 1 ) = 0.3 , P ( X = 1 ) = 0.4 , P ( X = 2 ) = 0.2
令 Y = X 2 Y = X^2 Y = X 2 。我们来求 Y Y Y 的 PMF。
确定 Y Y Y 的可能取值 :
X X X 的取值为 { − 2 , − 1 , 1 , 2 } \{-2, -1, 1, 2\} { − 2 , − 1 , 1 , 2 } ,因此 Y = X 2 Y = X^2 Y = X 2 的可能取值是 { ( − 2 ) 2 , ( − 1 ) 2 , 1 2 , 2 2 } = { 4 , 1 } \{(-2)^2, (-1)^2, 1^2, 2^2\} = \{4, 1\} {( − 2 ) 2 , ( − 1 ) 2 , 1 2 , 2 2 } = { 4 , 1 } 。
计算每个取值的概率 :
P ( Y = 1 ) = P ( X 2 = 1 ) = P ( X = − 1 or X = 1 ) P(Y = 1) = P(X^2 = 1) = P(X = -1 \text{ or } X = 1) P ( Y = 1 ) = P ( X 2 = 1 ) = P ( X = − 1 or X = 1 ) 。 由于事件 { X = − 1 } \{X=-1\} { X = − 1 } 和 { X = 1 } \{X=1\} { X = 1 } 是互斥的,我们可以直接将它们的概率相加: P ( Y = 1 ) = P ( X = − 1 ) + P ( X = 1 ) = 0.3 + 0.4 = 0.7 P(Y = 1) = P(X = -1) + P(X = 1) = 0.3 + 0.4 = 0.7 P ( Y = 1 ) = P ( X = − 1 ) + P ( X = 1 ) = 0.3 + 0.4 = 0.7 。
P ( Y = 4 ) = P ( X 2 = 4 ) = P ( X = − 2 or X = 2 ) P(Y = 4) = P(X^2 = 4) = P(X = -2 \text{ or } X = 2) P ( Y = 4 ) = P ( X 2 = 4 ) = P ( X = − 2 or X = 2 ) 。 P ( Y = 4 ) = P ( X = − 2 ) + P ( X = 2 ) = 0.1 + 0.2 = 0.3 P(Y = 4) = P(X = -2) + P(X = 2) = 0.1 + 0.2 = 0.3 P ( Y = 4 ) = P ( X = − 2 ) + P ( X = 2 ) = 0.1 + 0.2 = 0.3 。
得到 Y Y Y 的 PMF :
p Y ( 1 ) = 0.7 , p Y ( 4 ) = 0.3 p_Y(1) = 0.7, \quad p_Y(4) = 0.3 p Y ( 1 ) = 0.7 , p Y ( 4 ) = 0.3
我们可以验证所有概率之和为 0.7 + 0.3 = 1 0.7 + 0.3 = 1 0.7 + 0.3 = 1 。
连续随机变量的函数分布
当 X X X 是一个连续随机变量 时,求解其函数 Y = g ( X ) Y=g(X) Y = g ( X ) 的分布会更复杂。主要有两种常用方法:分布函数法 和变量替换法 。
方法一:分布函数法 (The CDF Method)
这是最基本、最通用的方法,适用于任何类型的函数 g ( x ) g(x) g ( x ) (包括非单调函数 )。其核心思想是先求出 Y Y Y 的累积分布函数 (CDF) F Y ( y ) F_Y(y) F Y ( y ) ,然后通过对 CDF 求导得到其概率密度函数 (PDF) f Y ( y ) f_Y(y) f Y ( y ) 。
步骤如下:
写出 Y Y Y 的 CDF 定义 :F Y ( y ) = P ( Y ≤ y ) F_Y(y) = P(Y \le y) F Y ( y ) = P ( Y ≤ y ) 。用 X X X 替换 Y Y Y :F Y ( y ) = P ( g ( X ) ≤ y ) F_Y(y) = P(g(X) \le y) F Y ( y ) = P ( g ( X ) ≤ y ) 。解不等式 :对不等式 g ( X ) ≤ y g(X) \le y g ( X ) ≤ y 求解,将其转化为关于 X X X 的一个或多个区间。这是此方法中最关键的一步。计算概率 :利用 X X X 的 CDF, F X ( x ) F_X(x) F X ( x ) , 或 PDF, f X ( x ) f_X(x) f X ( x ) , 计算上一步得到的关于 X X X 的区间的概率。求导得到 PDF :对 F Y ( y ) F_Y(y) F Y ( y ) 关于 y y y 求导,得到 Y Y Y 的 PDF:f Y ( y ) = d d y F Y ( y ) f_Y(y) = \frac{d}{dy}F_Y(y) f Y ( y ) = d y d F Y ( y ) 。
示例:
假设 X X X 服从参数为 λ \lambda λ 的指数分布 (Exponential Distribution),其 PDF 为 f X ( x ) = λ e − λ x f_X(x) = \lambda e^{-\lambda x} f X ( x ) = λ e − λ x for x > 0 x > 0 x > 0 。令 Y = X Y = \sqrt{X} Y = X ,求 Y Y Y 的分布。
Y Y Y 的 CDF :F Y ( y ) = P ( Y ≤ y ) F_Y(y) = P(Y \le y) F Y ( y ) = P ( Y ≤ y ) 。
首先确定 Y Y Y 的取值范围。由于 X > 0 X > 0 X > 0 ,因此 Y = X > 0 Y = \sqrt{X} > 0 Y = X > 0 。对于 y ≤ 0 y \le 0 y ≤ 0 ,F Y ( y ) = 0 F_Y(y) = 0 F Y ( y ) = 0 。我们只考虑 y > 0 y > 0 y > 0 的情况。
用 X X X 替换 Y Y Y :F Y ( y ) = P ( X ≤ y ) F_Y(y) = P(\sqrt{X} \le y) F Y ( y ) = P ( X ≤ y ) for y > 0 y > 0 y > 0 。
解不等式 :X ≤ y ⟹ 0 < X ≤ y 2 \sqrt{X} \le y \implies 0 < X \le y^2 X ≤ y ⟹ 0 < X ≤ y 2 。
计算概率 :
F Y ( y ) = P ( 0 < X ≤ y 2 ) = ∫ 0 y 2 f X ( x ) d x = ∫ 0 y 2 λ e − λ x d x F_Y(y) = P(0 < X \le y^2) = \int_0^{y^2} f_X(x) dx = \int_0^{y^2} \lambda e^{-\lambda x} dx F Y ( y ) = P ( 0 < X ≤ y 2 ) = ∫ 0 y 2 f X ( x ) d x = ∫ 0 y 2 λ e − λ x d x
F Y ( y ) = [ − e − λ x ] 0 y 2 = − e − λ y 2 − ( − e 0 ) = 1 − e − λ y 2 F_Y(y) = [-e^{-\lambda x}]_0^{y^2} = -e^{-\lambda y^2} - (-e^0) = 1 - e^{-\lambda y^2} F Y ( y ) = [ − e − λ x ] 0 y 2 = − e − λ y 2 − ( − e 0 ) = 1 − e − λ y 2
所以,Y Y Y 的 CDF 为:
F Y ( y ) = { 1 − e − λ y 2 if y > 0 0 if y ≤ 0 F_Y(y) = \begin{cases} 1 - e^{-\lambda y^2} & \text{if } y > 0 \\ 0 & \text{if } y \le 0 \end{cases} F Y ( y ) = { 1 − e − λ y 2 0 if y > 0 if y ≤ 0
求导得到 PDF :
对于 y > 0 y > 0 y > 0 ,
f Y ( y ) = d d y ( 1 − e − λ y 2 ) = − e − λ y 2 ⋅ ( − 2 λ y ) = 2 λ y e − λ y 2 f_Y(y) = \frac{d}{dy} (1 - e^{-\lambda y^2}) = -e^{-\lambda y^2} \cdot (-2\lambda y) = 2\lambda y e^{-\lambda y^2} f Y ( y ) = d y d ( 1 − e − λ y 2 ) = − e − λ y 2 ⋅ ( − 2 λ y ) = 2 λ y e − λ y 2
因此, Y Y Y 的 PDF 为:
f Y ( y ) = { 2 λ y e − λ y 2 if y > 0 0 if y ≤ 0 f_Y(y) = \begin{cases} 2\lambda y e^{-\lambda y^2} & \text{if } y > 0 \\ 0 & \text{if } y \le 0 \end{cases} f Y ( y ) = { 2 λ y e − λ y 2 0 if y > 0 if y ≤ 0
这被称为瑞利分布 (Rayleigh distribution)。
方法二:变量替换法 (The Change of Variable Formula)
这是一种更直接的计算 PDF 的方法,但它要求函数 y = g ( x ) y=g(x) y = g ( x ) 是严格单调的(严格递增或严格递减)并且可微。
假设 y = g ( x ) y = g(x) y = g ( x ) 是一个严格单调函数,那么它存在唯一的反函数 x = g − 1 ( y ) = h ( y ) x = g^{-1}(y) = h(y) x = g − 1 ( y ) = h ( y ) 。Y Y Y 的 PDF 可以通过以下公式直接得到:
f Y ( y ) = f X ( h ( y ) ) ⋅ ∣ d h ( y ) d y ∣ f_Y(y) = f_X(h(y)) \cdot \left| \frac{dh(y)}{dy} \right| f Y ( y ) = f X ( h ( y )) ⋅ d y d h ( y )
这里的 ∣ d h ( y ) d y ∣ \left| \frac{dh(y)}{dy} \right| d y d h ( y ) 是反函数导数的绝对值,它在多维情况下推广为雅可比行列式 (Jacobian)的绝对值。这个因子是必需的,因为它保证了变换后总概率仍然积分为1。
当函数不是单调时: 如果 g ( x ) g(x) g ( x ) 不是单调的,例如 Y = X 2 Y = X^2 Y = X 2 ,我们可以将 X X X 的定义域划分为多个区间,使 g ( x ) g(x) g ( x ) 在每个区间上都是单调的。然后,对每个区间应用变量替换法,并将结果相加。
若对于一个 y y y 值,有 k k k 个解 x 1 , x 2 , … , x k x_1, x_2, \dots, x_k x 1 , x 2 , … , x k 使得 g ( x i ) = y g(x_i) = y g ( x i ) = y ,那么 Y Y Y 的 PDF 是每一部分贡献的总和:
f Y ( y ) = ∑ i = 1 k f X ( h i ( y ) ) ⋅ ∣ d h i ( y ) d y ∣ f_Y(y) = \sum_{i=1}^k f_X(h_i(y)) \cdot \left| \frac{dh_i(y)}{dy} \right| f Y ( y ) = i = 1 ∑ k f X ( h i ( y )) ⋅ d y d h i ( y )
其中 x i = h i ( y ) x_i = h_i(y) x i = h i ( y ) 是第 i i i 个反函数。
示例:
假设 X X X 服从标准正态分布 N ( 0 , 1 ) N(0, 1) N ( 0 , 1 ) ,其 PDF 为 f X ( x ) = 1 2 π e − x 2 / 2 f_X(x) = \frac{1}{\sqrt{2\pi}} e^{-x^2/2} f X ( x ) = 2 π 1 e − x 2 /2 。令 Y = X 2 Y = X^2 Y = X 2 ,求 Y Y Y 的分布。
分析函数和反函数 :
函数 g ( x ) = x 2 g(x) = x^2 g ( x ) = x 2 不是单调的。对于任意 y > 0 y > 0 y > 0 ,有两个 x x x 值与之对应:x 1 = − y x_1 = -\sqrt{y} x 1 = − y (当 x < 0 x < 0 x < 0 时) 和 x 2 = y x_2 = \sqrt{y} x 2 = y (当 x > 0 x > 0 x > 0 时)。 我们有两个反函数:
x 1 = h 1 ( y ) = − y x_1 = h_1(y) = -\sqrt{y} x 1 = h 1 ( y ) = − y ,其导数为 h 1 ′ ( y ) = − 1 2 y h_1'(y) = -\frac{1}{2\sqrt{y}} h 1 ′ ( y ) = − 2 y 1 。x 2 = h 2 ( y ) = y x_2 = h_2(y) = \sqrt{y} x 2 = h 2 ( y ) = y ,其导数为 h 2 ′ ( y ) = 1 2 y h_2'(y) = \frac{1}{2\sqrt{y}} h 2 ′ ( y ) = 2 y 1 。
应用多对一公式 :
f Y ( y ) = f X ( h 1 ( y ) ) ⋅ ∣ h 1 ′ ( y ) ∣ + f X ( h 2 ( y ) ) ⋅ ∣ h 2 ′ ( y ) ∣ f_Y(y) = f_X(h_1(y)) \cdot |h_1'(y)| + f_X(h_2(y)) \cdot |h_2'(y)| f Y ( y ) = f X ( h 1 ( y )) ⋅ ∣ h 1 ′ ( y ) ∣ + f X ( h 2 ( y )) ⋅ ∣ h 2 ′ ( y ) ∣
代入 f X ( x ) f_X(x) f X ( x ) 的表达式:
f Y ( y ) = 1 2 π e − ( − y ) 2 / 2 ⋅ ∣ − 1 2 y ∣ + 1 2 π e − ( y ) 2 / 2 ⋅ ∣ 1 2 y ∣ f_Y(y) = \frac{1}{\sqrt{2\pi}} e^{-(-\sqrt{y})^2/2} \cdot \left|-\frac{1}{2\sqrt{y}}\right| + \frac{1}{\sqrt{2\pi}} e^{-(\sqrt{y})^2/2} \cdot \left|\frac{1}{2\sqrt{y}}\right| f Y ( y ) = 2 π 1 e − ( − y ) 2 /2 ⋅ − 2 y 1 + 2 π 1 e − ( y ) 2 /2 ⋅ 2 y 1
对于 y > 0 y > 0 y > 0 :
f Y ( y ) = 1 2 π e − y / 2 ⋅ 1 2 y + 1 2 π e − y / 2 ⋅ 1 2 y f_Y(y) = \frac{1}{\sqrt{2\pi}} e^{-y/2} \cdot \frac{1}{2\sqrt{y}} + \frac{1}{\sqrt{2\pi}} e^{-y/2} \cdot \frac{1}{2\sqrt{y}} f Y ( y ) = 2 π 1 e − y /2 ⋅ 2 y 1 + 2 π 1 e − y /2 ⋅ 2 y 1
f Y ( y ) = 2 ⋅ 1 2 π e − y / 2 ⋅ 1 2 y = 1 2 π y e − y / 2 f_Y(y) = 2 \cdot \frac{1}{\sqrt{2\pi}} e^{-y/2} \cdot \frac{1}{2\sqrt{y}} = \frac{1}{\sqrt{2\pi y}} e^{-y/2} f Y ( y ) = 2 ⋅ 2 π 1 e − y /2 ⋅ 2 y 1 = 2 π y 1 e − y /2
结论 :
Y = X 2 Y=X^2 Y = X 2 的 PDF 为 f Y ( y ) = 1 2 π y e − y / 2 f_Y(y) = \frac{1}{\sqrt{2\pi y}} e^{-y/2} f Y ( y ) = 2 π y 1 e − y /2 for y > 0 y > 0 y > 0 。这正是自由度 为1的卡方分布 (χ 2 ( 1 ) \chi^2(1) χ 2 ( 1 ) ) 的 PDF。这个结果在假设检验理论中至关重要。
多变量函数的推广
上述方法可以自然地推广到多个随机变量的函数情形。设 X 1 , X 2 , … , X n X_1, X_2, \dots, X_n X 1 , X 2 , … , X n 为 n n n 个随机变量,其联合分布已知,我们需要求出 Z = g ( X 1 , X 2 , … , X n ) Z = g(X_1, X_2, \dots, X_n) Z = g ( X 1 , X 2 , … , X n ) 的分布。
和的分布与卷积
当 Z = X + Y Z = X + Y Z = X + Y 且 X X X 与 Y Y Y 相互独立时,Z Z Z 的分布可通过卷积 公式求得。对于连续随机变量,Z Z Z 的 PDF 为:
f Z ( z ) = ∫ − ∞ ∞ f X ( x ) f Y ( z − x ) d x f_Z(z) = \int_{-\infty}^{\infty} f_X(x) f_Y(z - x) dx f Z ( z ) = ∫ − ∞ ∞ f X ( x ) f Y ( z − x ) d x
对于离散随机变量,Z Z Z 的 PMF 为:
p Z ( z ) = ∑ x p X ( x ) p Y ( z − x ) p_Z(z) = \sum_{x} p_X(x) p_Y(z - x) p Z ( z ) = x ∑ p X ( x ) p Y ( z − x )
卷积运算在信号处理、时间序列分析 和金融经济学 中有广泛应用。例如,独立同分布 随机变量之和的分布可以通过反复卷积得到,这为中心极限定理 提供了直观的数值验证途径。
商的分布
对于 Z = X / Y Z = X/Y Z = X / Y ,其中 X X X 和 Y Y Y 是相互独立的连续随机变量,Z Z Z 的分布可通过联合分布 的雅可比变换 推导得出:
f Z ( z ) = ∫ − ∞ ∞ ∣ y ∣ f X ( z y ) f Y ( y ) d y f_Z(z) = \int_{-\infty}^{\infty} |y| f_X(zy) f_Y(y) dy f Z ( z ) = ∫ − ∞ ∞ ∣ y ∣ f X ( zy ) f Y ( y ) d y
一个重要的特例是:当 X ∼ N ( 0 , 1 ) X \sim N(0,1) X ∼ N ( 0 , 1 ) 且 Y ∼ χ 2 ( n ) Y \sim \chi^2(n) Y ∼ χ 2 ( n ) 时,T = X / Y / n T = X/\sqrt{Y/n} T = X / Y / n 服从自由度 n n n 的{}t-分布{},这是小样本统计推断 的核心工具。
极值分布
在实际问题中,我们经常关心一组随机变量中的最大值或最小值。设 X 1 , X 2 , … , X n X_1, X_2, \dots, X_n X 1 , X 2 , … , X n 为独立同分布的随机变量,令 M n = max { X 1 , … , X n } M_n = \max\{X_1, \dots, X_n\} M n = max { X 1 , … , X n } 。M n M_n M n 的分布函数为:
F M n ( x ) = P ( M n ≤ x ) = P ( X 1 ≤ x , … , X n ≤ x ) = [ F X ( x ) ] n F_{M_n}(x) = P(M_n \le x) = P(X_1 \le x, \dots, X_n \le x) = [F_X(x)]^n F M n ( x ) = P ( M n ≤ x ) = P ( X 1 ≤ x , … , X n ≤ x ) = [ F X ( x ) ] n
类似地,最小值 m n = min { X 1 , … , X n } m_n = \min\{X_1, \dots, X_n\} m n = min { X 1 , … , X n } 的分布函数为:
F m n ( x ) = 1 − P ( m n > x ) = 1 − [ 1 − F X ( x ) ] n F_{m_n}(x) = 1 - P(m_n > x) = 1 - [1 - F_X(x)]^n F m n ( x ) = 1 − P ( m n > x ) = 1 − [ 1 − F X ( x ) ] n
极值分布理论在气象学 、工程可靠性 和风险管理 中具有重要应用。极值理论 进一步指出,经过适当标准化后的 M n M_n M n 收敛于广义极值分布 ,这一结论类似于中心极限定理对均值的收敛性。
数值方法与计算工具
当函数的解析形式过于复杂或不存在闭式解时,数值方法成为必要手段。
蒙特卡洛模拟 是最通用的数值方法之一。其基本思路是:从 X X X 的已知分布中抽取大量独立样本 x ( 1 ) , x ( 2 ) , … , x ( M ) x^{(1)}, x^{(2)}, \dots, x^{(M)} x ( 1 ) , x ( 2 ) , … , x ( M ) ,然后计算 y ( i ) = g ( x ( i ) ) y^{(i)} = g(x^{(i)}) y ( i ) = g ( x ( i ) ) ,最后通过直方图 或核密度估计 来近似 Y Y Y 的分布。随着样本量 M M M 的增大,蒙特卡洛估计依概率收敛于真实分布。这一方法不需要对 g g g 施加任何单调性或可微性假设,因此适用于极其复杂的函数变换。
矩生成函数 与特征函数 提供了另一类强大的解析工具。对于随机变量的独立和,矩生成函数满足 M X + Y ( t ) = M X ( t ) M Y ( t ) M_{X+Y}(t) = M_X(t) M_Y(t) M X + Y ( t ) = M X ( t ) M Y ( t ) ,而特征函数满足 ϕ X + Y ( t ) = ϕ X ( t ) ϕ Y ( t ) \phi_{X+Y}(t) = \phi_X(t) \phi_Y(t) ϕ X + Y ( t ) = ϕ X ( t ) ϕ Y ( t ) 。这一乘积性质使得求和运算在变换域中大大简化,再通过反变换即可得到分布的具体形式。
应用领域
随机变量函数的分布在以下领域具有核心地位: