知经百科 / Z

指数族分布 (Exponential Family)

指数族分布 (Exponential Family)

指数族分布 (Exponential Family) 是数理统计中具有统一代数结构的一类概率分布,其概率密度(或质量)函数可写作如下标准形式:

f(xθ)=h(x)exp(η(θ)T(x)A(θ))f(x \mid \theta) = h(x) \exp\left( \eta(\theta)^\top T(x) - A(\theta) \right)

其中 η(θ)\eta(\theta) 为自然参数,T(x)T(x) 为充分统计量,A(θ)A(\theta) 为对数配分函数(确保密度积分为1),h(x)h(x) 为基测度。指数族涵盖了统计学中最常用的分布——正态分布、泊松分布、二项分布、伽马分布、贝塔分布、指数分布和多项分布等——且为这些分布的统计推断提供了一套统一的理论工具。

关键统计性质

指数族分布具有若干在理论和应用上都极其重要的性质。其一,T(X)T(X) 为完备充分统计量——在满秩条件下(自然参数空间包含开集),T(X)T(X) 不仅保留了样本中关于参数的全部信息(充分性),而且这一信息的表示是唯一的(完备性),从而Lehmann-Scheffe定理保证基于 T(X)T(X) 的无偏函数即为UMVUE

其二,似然函数的对数在自然参数下为凹函数:(θ)=η(θ)T(x)A(θ)+logh(x)\ell(\theta) = \eta(\theta)^\top T(x) - A(\theta) + \log h(x) 的海森矩阵为 2A(θ)/ηη=Cov(T)-\partial^2 A(\theta)/\partial \eta \partial \eta^\top = -\operatorname{Cov}(T),该矩阵负定,保证极大似然估计求解中的优化问题在正则条件下有唯一全局最大值。其得分函数和Fisher信息量通过 T(X)T(X)A(θ)A(\theta) 的导数简洁表达:η=TE[T]\nabla_\eta \ell = T - \mathbb{E}[T]I(θ)=Covθ(T)I(\theta) = \operatorname{Cov}_\theta(T)

广义线性模型的核心支撑

指数族在计量经济学中最重要的应用是作为广义线性模型 (GLM) 的概率基础。GLM 将因变量分布从正态扩展至整个指数族——逻辑回归对应二项分布、泊松回归对应泊松分布、伽马回归对应伽马分布——通过连接函数 g(μ)=xβg(\mu) = \mathbf{x}^\top \boldsymbol{\beta} 将线性预测子与因变量的条件期望关联。这一统一的似然框架使得所有 GLM 的最大似然估计可通过相同的迭代再加权最小二乘 (IRLS) 算法求解,而似然比检验和 Wald 检验的渐近分布因指数族的正则性而一致成立。指数族由此架起了从独立同分布样本到结构化回归模型的统计推断桥梁。

返回百科索引