知经百科 / X

线性组合的分布

线性组合的分布 (Distribution of a Linear Combination)

线性组合的分布探讨概率论统计学中一个核心问题:将多个随机变量通过加权求和即线性组合结合时,新随机变量的概率分布如何确定。这是理解中心极限定理抽样分布以及金融中投资组合理论的基石。

随机变量的线性组合 (Linear Combination) 指形如

Y=a1X1+a2X2++anXn=i=1naiXiY = a_1 X_1 + a_2 X_2 + \dots + a_n X_n = \sum_{i=1}^n a_i X_i

的表达式。其中 X1,X2,,XnX_1, X_2, \dots, X_nnn 个随机变量,a1,a2,,ana_1, a_2, \dots, a_n 是已知常数,称为权重 (weights) 或系数 (coefficients)。

核心任务是,在已知每个 XiX_i 的概率分布及它们之间相互关系(如协方差)的条件下,确定 YY 的概率分布及其关键特征,包括期望方差

通用性质:期望与方差

无论构成线性组合的随机变量 XiX_i 服从何种分布,其期望和方差都遵循明确的数学法则。这些法则普适,不要求变量独立或服从特定分布。

线性组合的期望

期望算子 E[]E[\cdot] 具有线性性质,线性组合的期望等于各随机变量期望的线性组合。

对于任意随机变量 X1,,XnX_1, \dots, X_n 和任意常数 a1,,ana_1, \dots, a_n,线性组合 Y=i=1naiXiY = \sum_{i=1}^n a_i X_i 的期望为:

E[Y]=E[i=1naiXi]=i=1naiE[Xi]E[Y] = E\left[\sum_{i=1}^n a_i X_i\right] = \sum_{i=1}^n a_i E[X_i]

此性质极为强大,不要求随机变量之间统计独立

线性组合的方差

与期望不同,方差 Var()\operatorname{Var}(\cdot) 不具备完全线性。线性组合的方差不仅取决于各随机变量自身的方差,还取决于它们两两之间的协方差

对于任意随机变量 X1,,XnX_1, \dots, X_n 和任意常数 a1,,ana_1, \dots, a_n,线性组合 Y=i=1naiXiY = \sum_{i=1}^n a_i X_i 的方差为:

Var(Y)=i=1nai2Var(Xi)+21i<jnaiajCov(Xi,Xj)\operatorname{Var}(Y) = \sum_{i=1}^n a_i^2 \operatorname{Var}(X_i) + 2 \sum_{1 \le i < j \le n} a_i a_j \operatorname{Cov}(X_i, X_j)

紧凑形式为:

Var(Y)=i=1nj=1naiajCov(Xi,Xj)\operatorname{Var}(Y) = \sum_{i=1}^n \sum_{j=1}^n a_i a_j \operatorname{Cov}(X_i, X_j)

这里利用 Cov(Xi,Xi)=Var(Xi)\operatorname{Cov}(X_i, X_i) = \operatorname{Var}(X_i)

独立随机变量的特殊情况:当 X1,,XnX_1, \dots, X_n 相互独立时,协方差为零。方差公式简化:

Var(Y)=i=1nai2Var(Xi)\operatorname{Var}(Y) = \sum_{i=1}^n a_i^2 \operatorname{Var}(X_i)

这一简化形式在实践中广泛使用,因为许多统计模型假设样本数据独立同分布。

特定分布族的线性组合

虽然期望和方差的公式通用,但线性组合 YY 的确切概率分布形式依赖原始随机变量 XiX_i 的分布族。仅少数分布族在线性组合下具有封闭性。

正态分布

正态分布表现出最强封闭性,是其在统计学中占据核心地位的原因之一。

X1,,XnX_1, \dots, X_n 是独立的正态随机变量,其中 XiN(μi,σi2)X_i \sim N(\mu_i, \sigma_i^2),则任意线性组合 Y=i=1naiXiY = \sum_{i=1}^n a_i X_i 也服从正态分布。分布参数:

  • 均值:μY=E[Y]=i=1naiμi\mu_Y = E[Y] = \sum_{i=1}^n a_i \mu_i
  • 方差:σY2=Var(Y)=i=1nai2σi2\sigma_Y^2 = \operatorname{Var}(Y) = \sum_{i=1}^n a_i^2 \sigma_i^2

因此 YN(aiμi,ai2σi2)Y \sim N\left(\sum a_i \mu_i, \sum a_i^2 \sigma_i^2\right)

此性质可推广到非独立情况。若随机向量 (X1,,Xn)(X_1, \dots, X_n) 服从多元正态分布,则其任意线性组合 YY 仍服从一元正态分布。

其他具有可加性的分布

对其他常见分布,封闭性通常仅在求和(所有系数 ai=1a_i = 1)且变量独立时成立,称为可再生性或可加性:

  • 泊松分布:若 XiPoisson(λi)X_i \sim \operatorname{Poisson}(\lambda_i) 且相互独立,则 S=XiPoisson(λi)S = \sum X_i \sim \operatorname{Poisson}(\sum \lambda_i)
  • 卡方分布:若 Xiχ2(ki)X_i \sim \chi^2(k_i) 且相互独立,则 S=Xiχ2(ki)S = \sum X_i \sim \chi^2(\sum k_i)
  • 伽马分布:若 XiGamma(αi,β)X_i \sim \operatorname{Gamma}(\alpha_i, \beta) 且相互独立(需相同率参数 β\beta),则 S=XiGamma(αi,β)S = \sum X_i \sim \operatorname{Gamma}(\sum \alpha_i, \beta)
  • 二项分布:若 XiB(ni,p)X_i \sim B(n_i, p) 且相互独立(需相同成功概率 pp),则 S=XiB(ni,p)S = \sum X_i \sim B(\sum n_i, p)

除正态分布外,上述分布的封闭性通常不适用于系数不全为1的任意线性组合。

确定分布的方法

当线性组合的分布形式不明显时,可用更通用的数学工具推导。

矩生成函数法

矩生成函数 (MGF) 定义为 MX(t)=E[etX]M_X(t) = E[e^{tX}],具有两个核心性质:唯一性——若两个随机变量的MGF在 t=0t = 0 的邻域内相等,则概率分布相同;独立变量线性组合的MGF——若 X1,,XnX_1, \dots, X_n 相互独立且 Y=aiXiY = \sum a_i X_i,则

MY(t)=i=1nMXi(ait)M_Y(t) = \prod_{i=1}^n M_{X_i}(a_i t)

计算出 MY(t)M_Y(t) 后与已知分布匹配即确定 YY 的分布。

卷积法

对于两个独立随机变量的和 Z=X+YZ = X + Y,若为连续型,其概率密度函数 fZ(z)f_Z(z) 可通过卷积积分得到:

fZ(z)=fX(x)fY(zx)dxf_Z(z) = \int_{-\infty}^{\infty} f_X(x) f_Y(z-x) \,dx

离散变量的卷积为求和形式。此法概念清晰但计算上通常比MGF法更复杂。

应用实例

  • 统计推断:进行假设检验或构造置信区间时需知样本均值 Xˉ=1nXi\bar{X} = \frac{1}{n}\sum X_i 的分布。Xˉ\bar{X} 是随机样本的线性组合(ai=1/na_i = 1/n),从 N(μ,σ2)N(\mu, \sigma^2) 总体抽样时样本均值精确服从 N(μ,σ2/n)N(\mu, \sigma^2/n)
  • 金融学现代投资组合理论中组合总回报率为单个资产回报率的加权平均。设 RiR_i 为资产 ii 的回报率、wiw_i 为组合权重,则 Rp=wiRiR_p = \sum w_i R_i 为线性组合。理解 RpR_p 的期望和方差是资产配置和风险管理的核心。

返回百科索引