知经百科 / S

似然函数的定义

似然函数 (Likelihood Function)

似然函数 (Likelihood Function) 是统计学计量经济学中用于参数估计模型推断的核心概念。给定一组观测数据,似然函数描述了统计模型中未知参数的各个可能取值与这组数据出现的"可能性"之间的关系。

从本质上讲,似然函数衡量的是:在不同的参数值下,我们观测到的这组特定数据的合理性或"似然程度"。一个参数值如果使得观测数据出现的概率更大,那么这个参数值的"似然值"就更高。这一概念由统计学家罗纳德·艾尔默·费希尔(R. A. Fisher)提出,并成为频率学派统计的基石之一。

形式化定义

假设我们有一个随机样本 X1,X2,,XnX_1, X_2, \ldots, X_n,这些样本来自于一个由参数 θ\theta 决定的总体分布。这个分布的概率密度函数 (PDF) 或概率质量函数 (PMF) 表示为 f(xθ)f(x|\theta)。这里,θ\theta 是一个或一组未知参数,属于参数空间 Θ\Theta

当我们获得了一组具体的观测值 x1,x2,,xnx_1, x_2, \ldots, x_n 后,我们可以写出这组观测值出现的联合概率密度(或质量):

P(X1=x1,,Xn=xnθ)=f(x1,,xnθ)P(X_1=x_1, \ldots, X_n=x_n | \theta) = f(x_1, \ldots, x_n | \theta)

如果样本是独立同分布的,那么这个联合概率就是各个样本概率的乘积:

f(x1,,xnθ)=i=1nf(xiθ)f(x_1, \ldots, x_n | \theta) = \prod_{i=1}^{n} f(x_i | \theta)

此时,似然函数被定义为这个联合概率函数,但我们将其视为参数 θ\theta 的函数,记作 L(θx1,,xn)L(\theta | x_1, \ldots, x_n)

L(θx1,,xn)=i=1nf(xiθ)L(\theta | x_1, \ldots, x_n) = \prod_{i=1}^{n} f(x_i | \theta)

这里的关键转变在于视角的切换:

  • 在概率函数 f(xθ)f(x|\theta) 中,θ\theta 是固定的,变量是数据 xx。它描述了在给定模型下,不同数据出现的概率。
  • 在似然函数 L(θx)L(\theta|x) 中,xx(我们已经观测到的数据)是固定的,变量是参数 θ\theta。它描述了对于我们已有的这组数据,哪个参数值 θ\theta 使得这组数据出现的可能性最大。

核心区别:似然 (Likelihood) 与概率 (Probability)

初学者极易混淆"似然"与"概率"这两个概念,但它们的区别至关重要。

  • 概率是在参数已知的情况下,对结果的预测。例如:"假设一枚硬币是均匀的(参数 p=0.5p=0.5),抛掷10次得到7次正面的概率是多少?"这是一个关于数据的前向过程。
  • 似然是在数据已知的情况下,对参数的推断。例如:"如果抛掷一枚硬币10次得到了7次正面(数据已知),那么这枚硬币是均匀的(参数 p=0.5p=0.5)这一假设的似然值是多少?"这是一个关于参数的后向过程。

一个重要的数学区别是,概率函数 f(xθ)f(x|\theta) 对所有可能的样本空间积分(或求和)结果为1,即 f(xθ)dx=1\int f(x|\theta) dx = 1f(xθ)=1\sum f(x|\theta) = 1。而似然函数 L(θx)L(\theta|x) 对所有可能的参数空间 Θ\Theta 积分,其结果不一定为1。因此,似然值本身并不是一个概率,它只是一个相对的度量。我们不能说"参数 θ\theta 为某个值的概率是0.8",而只能比较 L(θ1x)L(\theta_1|x)L(θ2x)L(\theta_2|x) 的大小,判断在给定数据 xx 的情况下,θ1\theta_1 是否比 θ2\theta_2 更"似然"。

这一区别也体现了频率学派统计贝叶斯统计的哲学差异。在频率学派框架中,参数 θ\theta 是一个未知的常数,没有概率分布;而在贝叶斯框架中,参数 θ\theta 本身可以是一个随机变量,拥有先验概率后验概率

简单示例:抛硬币

假设我们有一枚质地可能不均匀的硬币,其抛出正面的概率为 pp。我们进行了10次独立的抛掷试验,观测到的结果是:正面、正面、反面、正面、正面、反面、正面、正面、正面、反面(共7次正面,3次反面)。

  1. 模型建立:每次抛掷可以看作是一次伯努利试验。其概率质量函数f(xp)=px(1p)1xf(x|p) = p^x (1-p)^{1-x},其中 x=1x=1 代表正面,x=0x=0 代表反面。
  2. 构建似然函数:由于各次试验是独立的,我们可以将10次观测的概率相乘,得到似然函数: \[ L(p | \text{数据}) = p \cdot p \cdot (1-p) \cdot p \cdot p \cdot (1-p) \cdot p \cdot p \cdot p \cdot (1-p) \] 简化后得到: \[ L(p | \text{7正3反}) = p^7 (1-p)^3 \]
  3. 分析似然函数:这个函数 L(p)L(p) 以参数 pp 为自变量。我们可以计算不同 pp 值下的似然值。 \begin{itemize}
  4. 如果 p=0.5p=0.5(硬币均匀),似然值为 L(0.5)=(0.5)7(0.5)3=(0.5)100.000976L(0.5) = (0.5)^7 (0.5)^3 = (0.5)^{10} \approx 0.000976
  5. 如果 p=0.7p=0.7,似然值为 L(0.7)=(0.7)7(0.3)30.08235×0.0270.00222L(0.7) = (0.7)^7 (0.3)^3 \approx 0.08235 \times 0.027 \approx 0.00222
  6. 如果 p=0.2p=0.2,似然值为 L(0.2)=(0.2)7(0.8)30.0000128×0.5126.55×106L(0.2) = (0.2)^7 (0.8)^3 \approx 0.0000128 \times 0.512 \approx 6.55 \times 10^{-6}。 \end{itemize}

通过比较可以发现,p=0.7p=0.7 时的似然值远高于 p=0.5p=0.5p=0.2p=0.2 时的似然值。这直观地表明,参数值 0.70.7 更好地解释了我们观测到的数据。而寻找使该似然函数达到最大值的 pp 值的过程,就是最大似然估计

对数似然函数 (Log-Likelihood Function)

在实际应用中,直接处理似然函数 L(θx)L(\theta|x) 常常会遇到困难,尤其是当样本量 nn 很大时。因为似然函数是多个小于1的概率值的连乘积,结果可能非常接近于零,导致计算机出现数值下溢问题。

为了解决这个问题并简化计算,我们通常使用对数似然函数,记作 (θx)\ell(\theta|x)logL(θx)\log L(\theta|x)

(θx)=logL(θx)=log(i=1nf(xiθ))=i=1nlogf(xiθ)\ell(\theta | x) = \log L(\theta | x) = \log \left( \prod_{i=1}^{n} f(x_i | \theta) \right) = \sum_{i=1}^{n} \log f(x_i | \theta)

使用对数似然函数有三大好处:

  1. 将乘积转化为求和:求和的计算和分析(特别是求导)远比乘积简单。
  2. 改善数值稳定性:避免了多个小概率连乘导致的数值下溢问题。
  3. 保持极值点不变:对数函数 y=log(x)y=\log(x) 是一个严格的单调递增函数。这意味着,使得似然函数 L(θx)L(\theta|x) 取得最大值的参数 θ^\hat{\theta},同样也会使得对数似然函数 (θx)\ell(\theta|x) 取得最大值。 \[ \arg\max_{\theta} L(\theta | x) = \arg\max_{\theta} \ell(\theta | x) \]

在上述抛硬币的例子中,对数似然函数为:

(p7正3反)=log(p7(1p)3)=7log(p)+3log(1p)\ell(p | \text{7正3反}) = \log(p^7 (1-p)^3) = 7\log(p) + 3\log(1-p)

对这个函数关于 pp 求导并令其为零,可以很容易地解出使似然最大化的 pp 值,即 p^=0.7\hat{p} = 0.7

主要应用

似然函数是现代统计推断的核心工具,其主要应用包括:

  • 最大似然估计:寻找使似然函数(或对数似然函数)最大化的参数值,作为对真实参数的最佳估计。这是最常用的一种点估计方法。
  • 似然比检验:一种强大的假设检验方法,通过比较有约束条件下的最大似然值和无约束条件下的最大似然值,来判断某个假设(如某个参数是否为零)是否成立。
  • 模型选择:基于似然值的信息准则,如赤池信息准则 (AIC) 和贝叶斯信息准则 (BIC),被广泛用于在多个候选模型中进行选择。这些准则在最大似然值的基础上,对模型复杂度(参数个数)进行惩罚,以避免过拟合
  • 置信区间的构造:基于似然函数的形状(特别是其二阶导数,即观测到的信息矩阵),可以构造参数的近似置信区间。

综上所述,似然函数提供了一个统一的框架,用于根据观测数据来评估和比较关于未知参数的各种假设,是连接数据和模型的重要桥梁。

返回百科索引