知经百科 / T

条件期望函数

条件期望函数(Conditional Expectation Function)

条件期望函数(Conditional Expectation Function,简称 CEF)是概率论与数理统计中描述随机变量之间依赖关系的核心工具。给定一个随机变量 YY 和另一个随机变量(或随机向量)XX,条件期望函数定义为 m(x)=E[YX=x]m(x) = \mathbb{E}[Y \mid X = x],即给定 XX 取值 xxYY 的条件均值。在计量经济学统计学机器学习中,CEF 是回归分析的理论基石——几乎所有参数回归方法(如OLS)和非参数回归方法(如KNN、核回归)的目标都是对 CEF 进行某种近似或估计。

正式定义

(Ω,F,P)(\Omega, \mathcal{F}, \mathbb{P}) 为一个概率空间,YY 是一个实值随机变量,XX 是一个 kk 维随机向量。条件期望 E[YX]\mathbb{E}[Y \mid X] 被定义为满足以下两个条件的随机变量:其一,E[YX]\mathbb{E}[Y \mid X]XX 的函数(即关于 σ(X)\sigma(X) 可测的);其二,对任意集合 Aσ(X)A \in \sigma(X),有 AE[YX]dP=AYdP\int_A \mathbb{E}[Y \mid X] \, d\mathbb{P} = \int_A Y \, d\mathbb{P}。这一公理化定义科尔莫戈罗夫(Kolmogorov)在其现代概率论框架中给出。当 XX 为离散型随机变量时,条件期望简化为:

E[YX=x]=yyP(Y=yX=x)\mathbb{E}[Y \mid X = x] = \sum_y y \cdot \mathbb{P}(Y = y \mid X = x)

(Y,X)(Y, X) 为连续型随机向量时,则表示为:

E[YX=x]=yfYX(yx)dy\mathbb{E}[Y \mid X = x] = \int_{-\infty}^{\infty} y \cdot f_{Y|X}(y|x) \, dy

其中 fYX(yx)=fY,X(y,x)/fX(x)f_{Y|X}(y|x) = f_{Y,X}(y,x) / f_X(x) 为条件概率密度函数。在实际应用中,XX 可能包含离散变量和连续变量的混合形式,此时条件期望需要结合求和与积分进行分段定义。从直观上看,CEF 可以理解为:将总体按照 XX 的取值划分为若干子总体后,在每个子总体内计算 YY 的平均值。这些平均值随 XX 变化的轨迹就是条件期望函数的图像。

核心性质

条件期望函数具有一系列深刻而优美的性质,这些性质构成了它在理论和应用两个层面上的力量源泉。

迭代期望定律(Law of Iterated Expectations)

迭代期望定律(LIE)是最重要的性质:E[Y]=E[E[YX]]\mathbb{E}[Y] = \mathbb{E}[\mathbb{E}[Y \mid X]]。它表明,无条件期望等于条件期望的无条件期望。这一公式的直观含义是:要预测 YY 的整体均值,可以先根据 XX 的信息进行分段预测,再将这些预测值按 XX 的分布加权平均。LIE 在计量经济学中应用极广——例如在方差分解 Var(Y)=Var(E[YX])+E[Var(YX)]\text{Var}(Y) = \text{Var}(\mathbb{E}[Y \mid X]) + \mathbb{E}[\text{Var}(Y \mid X)] 中,LIE 是推导的关键步骤。更一般地,对于嵌套的信息集 F1F2\mathcal{F}_1 \subset \mathcal{F}_2,有 E[E[YF2]F1]=E[YF1]\mathbb{E}[\mathbb{E}[Y \mid \mathcal{F}_2] \mid \mathcal{F}_1] = \mathbb{E}[Y \mid \mathcal{F}_1]。这一递推形式说明,先基于较多信息做出的预测,再基于较少信息对其取期望,等价于直接基于较少信息做出的预测——这符合直觉上"信息越多预测越准"的朴素认知。

最优预测性质

在均方误差(MSE)准则下,条件期望函数是 YY 基于 XX最优预测:对任意可测函数 g(X)g(X),有:

E[(YE[YX])2]E[(Yg(X))2]\mathbb{E}\left[(Y - \mathbb{E}[Y \mid X])^2\right] \leq \mathbb{E}\left[(Y - g(X))^2\right]

这一性质将 CEF 定位于预测理论的核心——线性回归的最优性仅在线性函数类中成立,而 CEF 在所有可测函数类中全局最优。证明思路是通过在条件期望两侧添加和减去 g(X)g(X),交叉项的期望在条件于 XX 时为零。换言之,CEF 是 YYL2L^2 空间到 XX 生成的子空间上的正交投影,这一几何解释使得 CEF 与泛函分析中的投影定理深刻关联。

线性性与平滑性

条件期望算子关于被条件化的变量呈线性:E[aY1+bY2X]=aE[Y1X]+bE[Y2X]\mathbb{E}[aY_1 + bY_2 \mid X] = a\mathbb{E}[Y_1 \mid X] + b\mathbb{E}[Y_2 \mid X]。这一性质使得 CEF 在线性回归框架中与OLS估计量建立了直接联系。此外,如果 YY 是可积的,则 E[YX]\mathbb{E}[Y \mid X] 几乎必然唯一存在。条件期望还满足单调性:若 Y1Y2Y_1 \leq Y_2 几乎必然成立,则 E[Y1X]E[Y2X]\mathbb{E}[Y_1 \mid X] \leq \mathbb{E}[Y_2 \mid X] 也几乎必然成立。詹森不等式(Jensen's Inequality)也对条件期望成立:若 ϕ\phi 为凸函数,则 ϕ(E[YX])E[ϕ(Y)X]\phi(\mathbb{E}[Y \mid X]) \leq \mathbb{E}[\phi(Y) \mid X]

与回归分析的关系

CEF 作为回归的靶点

在经典线性回归模型 Y=Xβ+εY = X'\beta + \varepsilon 中,假定 E[εX]=0\mathbb{E}[\varepsilon \mid X] = 0,即有 E[YX]=Xβ\mathbb{E}[Y \mid X] = X'\beta——此时 CEF 恰好是线性函数。然而,真实的 CEF 在大多数情况下是非线性的。OLS 估计量 β^\hat{\beta} 的本质是在线性函数类中寻找对 CEF 的最佳线性近似:β=argminbE[(YXb)2]\beta = \arg\min_b \mathbb{E}\left[(Y - X'b)^2\right],且有性质 E[YX]=Xβ+η\mathbb{E}[Y \mid X] = X'\beta + \eta,其中 η\eta 是线性投影误差,满足 E[Xη]=0\mathbb{E}[X\eta] = 0。这被称为线性投影(Linear Projection)——即使 CEF 不是线性的,OLS 系数仍然衡量了 CEF 的最佳线性逼近的斜率。

非参数估计

当 CEF 的数学形式未知时,可以使用核回归(Nadaraya-Watson 估计量)、局部多项式样条随机森林等非参数方法进行估计。这些方法不预先假定 CEF 的参数形式,而是在数据的驱动下灵活拟合。核回归的估计形式为 m^(x)=iKh(xXi)Yi/jKh(xXj)\hat{m}(x) = \sum_i K_h(x - X_i) Y_i / \sum_j K_h(x - X_j),其中 KhK_h 为带宽参数为 hh 的核函数。在因果推断中,CEF 的非参数估计是估计平均处理效应(ATE)的前置步骤——通过估计 E[YX]\mathbb{E}[Y \mid X] 来构建倾向得分或进行回归调整

CEF 与因果解释的边界

需要特别指出的是,条件期望函数仅描述条件相关性,而非因果效应。即使 E[YX]\mathbb{E}[Y \mid X]XX 而变,也不能直接解读为 XX 引起了 YY 的变化——可能存在遗漏变量、反向因果或选择偏差。从 CEF 到因果推断需要额外的识别条件,如条件独立性假设 Y(0),Y(1) ⁣ ⁣ ⁣DXY(0), Y(1) \perp\!\!\!\perp D \mid X(其中 DD 为处理变量),这正是鲁宾因果模型倾向得分匹配的理论基础。在自然实验工具变量法中,研究者利用外生变异来识别 CEF 中的因果参数,这就是结构计量经济学的基本思路。

广义化与相关概念

条件中位数函数(Conditional Median Function)m0.5(x)=Median(YX=x)m_{0.5}(x) = \text{Median}(Y \mid X = x) 是对 CEF 的稳健替代,在分位数回归中通过最小化绝对偏差(L1 损失)来估计。更一般地,条件分位数函数 Qτ(YX)Q_\tau(Y \mid X) 刻画了 YY 条件分布的各分位点随 XX 的变化轨迹,提供了 CEF(τ=0.5 的特殊情况)所无法展现的分布异质性信息。例如,教育回报率在不同收入分位点上的差异可以用分位数回归揭示。

随机过程理论中,(Martingale)定义为满足 E[Xt+1Ft]=Xt\mathbb{E}[X_{t+1} \mid \mathcal{F}_t] = X_t 的随机过程——这是 CEF 在时间序列语境中的重要应用。布朗运动泊松过程等基础随机过程均可构造为鞅或其变形。在金融经济学中,鞅性质是有效市场假说(EMH)的数学基础——在风险中性测度下,折现后的资产价格过程是一个鞅。

信息经济学中,CEF 刻画了经济主体在给定信息集下的最优预期行为——例如在理性预期(Rational Expectations)假设下,主体对价格的预期等于 E[Pt+1It]\mathbb{E}[P_{t+1} \mid \mathcal{I}_t],其中 It\mathcal{I}_t 为当前信息集。CEF 因而成为连接微观个体决策与宏观均衡结果的理论桥梁。在贝叶斯统计中,后验均值正是条件期望 E[θX]\mathbb{E}[\theta \mid X] 在参数估计中的直接应用,其中 θ\theta 为未知参数、XX 为观测数据。

返回百科索引