知经百科 / X

先验概率 (prior probability)

先验概率 (Prior Probability)

先验概率贝叶斯统计中的核心概念,指在观测到新的数据或证据之前,对某一不确定事件或参数所持有的初始信念(belief),以概率分布的形式表达。贝叶斯推断的完整逻辑链条为:先验概率 + 数据(似然)→ 后验概率 (posterior probability)。因此,先验概率是贝叶斯分析的起点,其选择对推断结果有直接影响。

数学定义

在贝叶斯框架下,设 θ\theta 为感兴趣的未知参数,X=(X1,X2,,Xn)\mathbf{X} = (X_1, X_2, \ldots, X_n) 为观测数据。先验概率通常表示为 π(θ)\pi(\theta)(连续情形)或 P(θ)P(\theta)(离散情形),它反映了在观测数据之前对 θ\theta 的主观或客观信念。根据贝叶斯定理,后验分布为:

π(θX)=f(Xθ)π(θ)Θf(Xθ)π(θ)dθ=似然×先验边缘似然(归一化常数)\pi(\theta \mid \mathbf{X}) = \frac{f(\mathbf{X} \mid \theta) \, \pi(\theta)}{\int_\Theta f(\mathbf{X} \mid \theta) \, \pi(\theta) \, d\theta} = \frac{\text{似然} \times \text{先验}}{\text{边缘似然(归一化常数)}}

其中 f(Xθ)f(\mathbf{X} \mid \theta)似然函数,分母为边缘分布(亦称证据或归一化常数),用以保证后验分布积分为 1。

在比例形式下,贝叶斯定理可简写为:

π(θX)f(Xθ)π(θ)\pi(\theta \mid \mathbf{X}) \propto f(\mathbf{X} \mid \theta) \cdot \pi(\theta)

即后验正比于似然与先验的乘积,这便是"先验被数据更新"这一直觉的数学表达。

先验的分类

先验分布按信息含量和数学性质可分为若干类型,选择取决于分析目的、可用信息和计算便利性。

无信息先验 (Non-informative Prior)

当研究者希望数据主导推断结果、尽量减少主观因素的干扰时,会采用无信息先验。最常见的无信息先验包括:

  • 均匀先验 (Uniform Prior)π(θ)1\pi(\theta) \propto 1,适用于有限区间上的参数,表达"在区间内对所有值一视同仁"。
  • 杰弗里斯先验 (Jeffreys Prior)π(θ)I(θ)\pi(\theta) \propto \sqrt{I(\theta)},其中 I(θ)I(\theta)费歇尔信息量。该先验在参数变换下具有不变性,被广泛视为客观先验的默认选择。
  • 参考先验 (Reference Prior):由 Bernardo 提出,旨在最大化数据与先验之间的 KL 散度,使数据在推断中发挥最大作用。

无信息先验常为非正常先验 (improper prior),即其积分发散(π(θ)dθ=\int \pi(\theta) d\theta = \infty),但只要得到的后验分布是正常的(可积),在贝叶斯框架中仍可使用。

信息先验 (Informative Prior)

当研究者在观测数据前已拥有实质性先验知识(来自过往研究、专家判断或理论约束),则可构建信息先验,将已有知识正式编码进概率分布。例如:

  • 在医学试验中,利用历史试验数据构建当前疗效参数的先验分布。
  • 宏观经济预测中,根据 DSGE 模型的校准结果设定参数的先验区间。
  • 在 A/B 测试中,使用之前实验的转化率作为当前实验的 Beta 先验。

信息先验能够提高小样本下的估计精度,但也带来了"先验可能主导数据"的风险,因此需进行敏感性分析。

共轭先验 (Conjugate Prior)

若先验分布 π(θ)\pi(\theta) 与似然函数 f(Xθ)f(\mathbf{X} \mid \theta) 属于同一分布族,使得后验分布 π(θX)\pi(\theta \mid \mathbf{X}) 与先验具有相同的函数形式,则称该先验为共轭先验。共轭性极大简化了后验的计算——只需更新分布参数。

常见的共轭配对如下:

\begin{tabular}{lll} 似然(数据分布) \& 参数 \& 共轭先验 \\ \hline 二项分布 \& 成功概率 pp \& Beta 分布 \\ 泊松分布 \& 速率 λ\lambda \& Gamma 分布 \\ 正态分布(方差已知) \& 均值 μ\mu \& 正态分布 \\ 正态分布(均值已知) \& 方差 σ2\sigma^2 \& 逆 Gamma 分布 \\ 多项分布 \& 概率向量 p\mathbf{p} \& Dirichlet 分布 \\ 指数分布 \& 速率 λ\lambda \& Gamma 分布 \\ \end{tabular}

例:Beta-二项共轭。设 XθBinomial(n,θ)X \mid \theta \sim \text{Binomial}(n, \theta),先验 θBeta(α,β)\theta \sim \text{Beta}(\alpha, \beta),则后验为:

θX=xBeta(α+x,β+nx)\theta \mid X = x \sim \text{Beta}(\alpha + x, \beta + n - x)

可以将 α\alphaβ\beta 分别理解为"先验成功次数"和"先验失败次数"——数据仅需在原基础上累加,直观且易算。

分层先验 (Hierarchical Prior)

分层贝叶斯模型中,先验本身的参数(即超参数)不再固定,而是被赋予另一层先验分布,形成多层结构:

Xθf(Xθ),θϕπ(θϕ),ϕπ(ϕ)\mathbf{X} \mid \theta \sim f(\mathbf{X} \mid \theta), \quad \theta \mid \phi \sim \pi(\theta \mid \phi), \quad \phi \sim \pi(\phi)

分层先验的优势在于能够自然地建模组间异质性(如在随机效应模型元分析中),并实现不同组之间的部分池化(partial pooling)。

主观先验与客观先验

贝叶斯学派内部存在一条关键分界线——主观贝叶斯客观贝叶斯——二者对先验的性质有根本不同的理解。

主观贝叶斯(以 de Finetti、Savage 为代表)认为概率是个人信念程度的度量,因此先验天然是主观的:它反映分析者在看到数据之前的诚实信念,不同分析者使用不同先验完全合理。该观点的核心在于,随着数据积累,不同合理的先验最终会收敛到相同的后验(先验的渐近无关性)。

客观贝叶斯(以 Jeffreys、Bernardo 为代表)则致力于构造"默认先验",使贝叶斯分析在无实质性先验信息时也能产生频率学意义上优良的推断。此类先验通常基于信息几何或决策理论准则推导而来。

实践中,双方面临的共同挑战是先验敏感性分析:对先验的合理扰动是否会导致后验推断发生质的改变?如果后验对先验高度敏感,则意味着数据信息不足,研究者需审慎解释结果。

先验概率的构建方法

基于历史数据

当存在可用的历史数据时,一种常见策略是使用幂先验 (power prior):将历史似然提升至某个指数 0a010 \leq a_0 \leq 1 后用作当前分析的先验。a0a_0 控制历史数据相对于当前数据的权重——a0=0a_0 = 0 完全忽略历史数据,a0=1a_0 = 1 将历史数据视作与当前数据同等重要。

专家意见提取 (Prior Elicitation)

在没有历史数据的领域,可从领域专家处提取先验信息。常见流程包括:

  1. 请专家以分位数(如中位数、第 25 和第 75 百分位数)表达对参数的不确定性。
  2. 拟合一个参数分布以匹配专家给出的分位数。
  3. 通过反馈循环校准和验证拟合结果。

这一过程在风险评估药物开发气候建模中已有成熟应用。

最大熵先验

基于最大熵原理,在给定约束(如已知矩条件)下,选择使熵最大的分布作为先验,以最小化额外的主观假设。例如,已知参数均值和方差时,最大熵先验为正态分布;已知参数取值范围且无其他信息时,最大熵先验为均匀分布。

先验概率与频率学派的关系

频率学派(经典统计学)不使用先验分布:参数被视为固定的未知常数,推断完全基于抽样分布。然而,在某些解读下,频率方法可视为使用退化先验(flat/improper prior)的贝叶斯方法的极限情形。例如:

  • 在正态均值模型中,使用均匀先验 π(μ)1\pi(\mu) \propto 1 所得的后验均值正是样本均值,与频率学派的 MLE 重合。
  • 在大样本下,伯恩斯坦-冯·米塞斯定理 (Bernstein–von Mises theorem) 保证了后验分布渐近独立于先验,且收敛于以 MLE 为中心的正态分布。

这一渐近结果构成了贝叶斯与频率学派之间的一座重要桥梁:数据量足够大时,先验的影响趋于消失,两派的推断结论趋同。

常见误区与注意事项

  • 误区一:先验概率就是"猜测"。 先验并非随意的猜测,而应基于理论、数据或经过校准的专家知识。在缺乏实质信息时,应采用经过理论论证的无信息先验。
  • 误区二:无信息先验代表"零信息"。 在参数变换下,一个在 θ\theta 上是均匀的先验,在 logθ\log\theta 上就不再均匀。真正的"无信息"依赖于参数化——这也是杰弗里斯先验试图解决的不变性问题。
  • 误区三:大样本下先验不重要,因此无需认真选择。 尽管渐近理论保证了先验的无关性,但在有限样本(尤其是参数维度较高)的实际问题中,先验的选择仍可能实质影响推断结果。
  • 误区四:共轭先验只是为了计算方便。 虽然计算简便确实是共轭先验的重要优势,但许多共轭族也有合理的实质解释(如 Beta 先验可解释为虚拟的先验观测)。

应用示例:硬币公平性检验

假设我们怀疑一枚硬币可能不公平,掷 n=20n = 20 次,观测到 x=14x = 14 次正面。我们要推断正面概率 θ\theta

场景一:弱信息先验

使用 θBeta(2,2)\theta \sim \text{Beta}(2, 2)(对称但向中心轻微收缩的先验)。后验为:

θxBeta(2+14,2+6)=Beta(16,8)\theta \mid x \sim \text{Beta}(2 + 14, 2 + 6) = \text{Beta}(16, 8)

后验均值为 16/(16+8)0.66716/(16+8) \approx 0.667,后验 95\% 等尾区间约为 [0.47,0.83][0.47, 0.83]

场景二:强先验——硬币应公平

使用 θBeta(100,100)\theta \sim \text{Beta}(100, 100)(强先验,集中在 0.5)。后验为:

θxBeta(100+14,100+6)=Beta(114,106)\theta \mid x \sim \text{Beta}(100 + 14, 100 + 6) = \text{Beta}(114, 106)

后验均值为 114/(114+106)0.518114/(114+106) \approx 0.518,95\% 区间约为 [0.45,0.58][0.45, 0.58]。即使观测到 70\% 的正面率,强先验仍将后验拉回 0.5 附近。

该示例清楚地展示了先验强度对后验的影响:当数据有限时,强先验可能"淹没"数据信号;而弱先验则允许数据主导推断。

延伸阅读

先验概率的选择是贝叶斯统计中最富争议也最具创造性的环节,相关概念包括后验概率 (posterior probability)贝叶斯定理共轭先验杰弗里斯先验最大熵原理分层贝叶斯模型。在实际应用中,读者还应了解马尔可夫链蒙特卡洛方法 (MCMC),它是现代贝叶斯计算中处理非共轭先验和复杂模型的基石。

返回百科索引