知经百科 / Z

最大似然估计 (MLE)

最大似然估计 (Maximum Likelihood Estimation)

最大似然估计(Maximum Likelihood Estimation,简称 MLE)是统计推断中最为经典且应用广泛的参数估计方法之一。其核心思想直观而深刻:给定一组观测数据,我们寻找能使该数据出现的概率(即似然函数)最大化的参数值,以此作为未知参数的估计量。这一方法由英国统计学家罗纳德·费希尔(Ronald Fisher)在20世纪初系统性地提出,奠定了现代参数估计理论的基础。在经济学、金融学、生物统计学和机器学习等领域,MLE 都是估计模型参数的标准工具。

基本思想与直观理解

最大似然估计的基本逻辑是:在所有的参数候选值中,最合理的应该是那个使得我们实际观测到的样本数据最有可能出现的参数值。换言之,我们选择参数 θ\theta 使得观测数据的概率最大化。

以一个简单的例子来说明。假设我们抛一枚硬币10次,结果是7次正面、3次反面。如果硬币正面朝上的概率为 pp,那么这一观测结果出现的概率为 L(p)=p7(1p)3L(p) = p^7 (1-p)^3。最大似然估计的任务就是找出使 L(p)L(p) 最大的 pp 值。通过简单的微积分求导可得 p^=0.7\hat{p} = 0.7,这与我们的直觉完全吻合。

似然函数的定义

X1,X2,,XnX_1, X_2, \ldots, X_n 是从概率密度函数(或概率质量函数)为 f(x;θ)f(x;\theta) 的分布中独立抽取的样本,其中 θ\theta 为待估计的未知参数。样本的似然函数定义为所有观测值联合概率密度函数的乘积:

L(θ;x1,x2,,xn)=i=1nf(xi;θ)L(\theta; x_1, x_2, \ldots, x_n) = \prod_{i=1}^{n} f(x_i; \theta)

似然函数与概率分布函数在数学形式上相似,但二者的解释角度截然不同:概率分布函数将参数 θ\theta 视为固定值,将数据视为随机变量;而似然函数则将数据视为已知的观测值,将参数 θ\theta 视为变量。在给定数据下,似然函数衡量的是不同参数值 θ\theta 与数据的相容程度。

在实际计算中,通常取似然函数的自然对数,得到对数似然函数

(θ)=lnL(θ)=i=1nlnf(xi;θ)\ell(\theta) = \ln L(\theta) = \sum_{i=1}^{n} \ln f(x_i; \theta)

取对数不仅可以将乘积转化为便于操作的求和形式,而且对数函数是严格单调的,因此最大化 (θ)\ell(\theta) 与最大化 L(θ)L(\theta) 等价。

最大似然估计量的求解

最大似然估计量 θ^MLE\hat{\theta}_{\text{MLE}} 通过最大化对数似然函数得到:

θ^MLE=argmaxθΘ(θ)\hat{\theta}_{\text{MLE}} = \arg\max_{\theta \in \Theta} \ell(\theta)

其中 Θ\Theta 为参数空间。当对数似然函数关于 θ\theta 可微时,通常可通过求解以下似然方程来得到极值点:

(θ)θ=0\frac{\partial \ell(\theta)}{\partial \theta} = 0

正态分布 N(μ,σ2)N(\mu, \sigma^2) 为例,设 X1,,XnX_1, \ldots, X_n 为独立同分布样本,其对数似然函数为:

(μ,σ2)=n2ln(2π)n2ln(σ2)12σ2i=1n(Xiμ)2\ell(\mu, \sigma^2) = -\frac{n}{2} \ln(2\pi) - \frac{n}{2} \ln(\sigma^2) - \frac{1}{2\sigma^2} \sum_{i=1}^{n} (X_i - \mu)^2

求偏导并令其为零,可得:

μ^MLE=Xˉ=1ni=1nXi,σ^MLE2=1ni=1n(XiXˉ)2\hat{\mu}_{\text{MLE}} = \bar{X} = \frac{1}{n} \sum_{i=1}^{n} X_i, \quad \hat{\sigma}^2_{\text{MLE}} = \frac{1}{n} \sum_{i=1}^{n} (X_i - \bar{X})^2

值得注意的是,正态分布方差的最大似然估计量 σ^MLE2\hat{\sigma}^2_{\text{MLE}} 是有偏的,其分母为 nn 而非 n1n-1。不过在大样本下该偏差趋于零,即估计量具有一致性。

最大似然估计的优良性质

最大似然估计在大样本下具有一系列引人注目的优良性质,这也是其在统计学中占据核心地位的重要原因。

  1. 一致性 (Consistency):在适当的正则条件下,当样本容量 nn \to \infty 时,MLE θ^MLE\hat{\theta}_{\text{MLE}} 依概率收敛于参数真值 θ0\theta_0。这意味着随着样本量的增加,估计量越来越接近真实参数值。
  2. 渐近正态性 (Asymptotic Normality):MLE 在大样本下近似服从正态分布: \[ \hat{\theta}_{\text{MLE}} \xrightarrow{d} N\left(\theta_0, \frac{1}{n} \mathcal{I}(\theta_0)^{-1}\right) \] 其中 I(θ0)\mathcal{I}(\theta_0)费希尔信息量(Fisher Information),衡量的是数据中包含的有关参数的信息量。这一性质使得我们可以构造参数的置信区间并进行假设检验
  3. 渐近有效性 (Asymptotic Efficiency):在所有一致的渐近正态估计量中,MLE 具有最小的渐近方差,即它达到了克拉默-拉奥下界(Cramér-Rao Lower Bound)。这意味着在大样本下,没有其他一致估计量能比 MLE 拥有更高的精度。
  4. 参数变换不变性 (Invariance):如果 θ^\hat{\theta}θ\theta 的 MLE,那么对任意函数 g()g(\cdot)g(θ^)g(\hat{\theta}) 也是 g(θ)g(\theta) 的 MLE。这一性质使得我们可以在参数变换后直接得到新参数的 MLE,无需重新进行最优化。

在计量经济学中的应用

计量经济学中,最大似然估计是估计非线性模型的标准方法。典型的应用包括:

  • 逻辑回归模型:对于二元选择模型,MLE 通过最大化伯努利分布的乘积来估计回归系数,其对数似然函数为: \[ \ell(\boldsymbol{\beta}) = \sum_{i=1}^{n} \left[ y_i \ln\Lambda(\mathbf{x}_i^\top \boldsymbol{\beta}) + (1 - y_i) \ln(1 - \Lambda(\mathbf{x}_i^\top \boldsymbol{\beta})) \right] \] 其中 Λ()\Lambda(\cdot)Logistic函数。由于一阶条件为非线性方程,通常需要借助牛顿-拉夫逊算法等数值优化方法求解。
  • 泊松回归模型:用于处理计数数据,其对数似然函数为: \[ \ell(\boldsymbol{\beta}) = \sum_{i=1}^{n} \left[ y_i \mathbf{x}_i^\top \boldsymbol{\beta} - \exp(\mathbf{x}_i^\top \boldsymbol{\beta}) - \ln(y_i!) \right] \]
  • 时间序列模型:在ARMA模型GARCH模型等时间序列模型的估计中,MLE 同样是首选的估计方法,只需将似然函数调整为考虑序列相关性的形式。

MLE 与最小二乘法的关系

线性回归模型的经典假设下(误差项服从独立同分布的正态分布),最大似然估计与普通最小二乘法(Ordinary Least Squares, OLS)给出的参数估计量完全一致。此时,最大化对数似然函数等价于最小化残差平方和。然而,当误差项不服从正态分布时,二者的结果会出现差异,此时 MLE 仍然保持渐近有效性,而 OLS 可能失去某些优良性质。

数值优化与计算挑战

对于许多复杂的模型,似然方程往往没有解析解,需要借助数值优化算法求解。常用的算法包括:

  • 牛顿-拉夫逊算法 (Newton-Raphson):利用一阶导数和二阶导数(Hessian 矩阵)进行迭代更新,收敛速度快但每次迭代的计算量较大。
  • 拟牛顿法 (Quasi-Newton Methods):如 BFGS 算法,用梯度信息近似 Hessian 矩阵,在计算效率和收敛速度之间取得了良好平衡。
  • 期望最大化算法 (EM Algorithm):专门处理含有潜在变量或缺失数据的情形,通过交替执行期望步和最大化步来逐步逼近 MLE。

在实际应用中,可能面临多重共线性导致 Hessian 矩阵奇异、似然函数具有多个局部极值等问题,需要结合稳健的标准误估计和多种初始值策略加以应对。

总结与评价

最大似然估计以其坚实的理论基础和优良的渐近性质,成为统计学和计量经济学中最重要的参数估计方法。它提供了一套统一的框架,能够系统地处理从简单分布到复杂结构模型的参数估计问题。尽管在小样本下 MLE 可能存在偏误,且对模型设定错误较为敏感,但其在大样本下的一致性、渐近正态性和渐近有效性使其在理论与实践中均占据不可替代的核心地位。与矩估计(Method of Moments)和贝叶斯估计(Bayesian Estimation)等其他估计方法相比,MLE 在信息利用效率和理论完备性方面具有独特的优势。

返回百科索引