条件期望函数(Conditional Expectation Function)
条件期望函数(Conditional Expectation Function,简称 CEF)是概率论与数理统计中描述随机变量之间依赖关系的核心工具。给定一个随机变量 Y 和另一个随机变量(或随机向量)X,条件期望函数定义为 m(x)=E[Y∣X=x],即给定 X 取值 x 时 Y 的条件均值。在计量经济学、统计学和机器学习中,CEF 是回归分析的理论基石——几乎所有参数回归方法(如OLS)和非参数回归方法(如KNN、核回归)的目标都是对 CEF 进行某种近似或估计。
正式定义
设 (Ω,F,P) 为一个概率空间,Y 是一个实值随机变量,X 是一个 k 维随机向量。条件期望 E[Y∣X] 被定义为满足以下两个条件的随机变量:其一,E[Y∣X] 是 X 的函数(即关于 σ(X) 可测的);其二,对任意集合 A∈σ(X),有 ∫AE[Y∣X]dP=∫AYdP。这一公理化定义由科尔莫戈罗夫(Kolmogorov)在其现代概率论框架中给出。当 X 为离散型随机变量时,条件期望简化为:
E[Y∣X=x]=y∑y⋅P(Y=y∣X=x)
当 (Y,X) 为连续型随机向量时,则表示为:
E[Y∣X=x]=∫−∞∞y⋅fY∣X(y∣x)dy
其中 fY∣X(y∣x)=fY,X(y,x)/fX(x) 为条件概率密度函数。在实际应用中,X 可能包含离散变量和连续变量的混合形式,此时条件期望需要结合求和与积分进行分段定义。从直观上看,CEF 可以理解为:将总体按照 X 的取值划分为若干子总体后,在每个子总体内计算 Y 的平均值。这些平均值随 X 变化的轨迹就是条件期望函数的图像。
核心性质
条件期望函数具有一系列深刻而优美的性质,这些性质构成了它在理论和应用两个层面上的力量源泉。
迭代期望定律(Law of Iterated Expectations)
迭代期望定律(LIE)是最重要的性质:E[Y]=E[E[Y∣X]]。它表明,无条件期望等于条件期望的无条件期望。这一公式的直观含义是:要预测 Y 的整体均值,可以先根据 X 的信息进行分段预测,再将这些预测值按 X 的分布加权平均。LIE 在计量经济学中应用极广——例如在方差分解 Var(Y)=Var(E[Y∣X])+E[Var(Y∣X)] 中,LIE 是推导的关键步骤。更一般地,对于嵌套的信息集 F1⊂F2,有 E[E[Y∣F2]∣F1]=E[Y∣F1]。这一递推形式说明,先基于较多信息做出的预测,再基于较少信息对其取期望,等价于直接基于较少信息做出的预测——这符合直觉上"信息越多预测越准"的朴素认知。
最优预测性质
在均方误差(MSE)准则下,条件期望函数是 Y 基于 X 的最优预测:对任意可测函数 g(X),有:
E[(Y−E[Y∣X])2]≤E[(Y−g(X))2]
这一性质将 CEF 定位于预测理论的核心——线性回归的最优性仅在线性函数类中成立,而 CEF 在所有可测函数类中全局最优。证明思路是通过在条件期望两侧添加和减去 g(X),交叉项的期望在条件于 X 时为零。换言之,CEF 是 Y 在 L2 空间到 X 生成的子空间上的正交投影,这一几何解释使得 CEF 与泛函分析中的投影定理深刻关联。
线性性与平滑性
条件期望算子关于被条件化的变量呈线性:E[aY1+bY2∣X]=aE[Y1∣X]+bE[Y2∣X]。这一性质使得 CEF 在线性回归框架中与OLS估计量建立了直接联系。此外,如果 Y 是可积的,则 E[Y∣X] 几乎必然唯一存在。条件期望还满足单调性:若 Y1≤Y2 几乎必然成立,则 E[Y1∣X]≤E[Y2∣X] 也几乎必然成立。詹森不等式(Jensen's Inequality)也对条件期望成立:若 ϕ 为凸函数,则 ϕ(E[Y∣X])≤E[ϕ(Y)∣X]。
与回归分析的关系
CEF 作为回归的靶点
在经典线性回归模型 Y=X′β+ε 中,假定 E[ε∣X]=0,即有 E[Y∣X]=X′β——此时 CEF 恰好是线性函数。然而,真实的 CEF 在大多数情况下是非线性的。OLS 估计量 β^ 的本质是在线性函数类中寻找对 CEF 的最佳线性近似:β=argminbE[(Y−X′b)2],且有性质 E[Y∣X]=X′β+η,其中 η 是线性投影误差,满足 E[Xη]=0。这被称为线性投影(Linear Projection)——即使 CEF 不是线性的,OLS 系数仍然衡量了 CEF 的最佳线性逼近的斜率。
非参数估计
当 CEF 的数学形式未知时,可以使用核回归(Nadaraya-Watson 估计量)、局部多项式、样条或随机森林等非参数方法进行估计。这些方法不预先假定 CEF 的参数形式,而是在数据的驱动下灵活拟合。核回归的估计形式为 m^(x)=∑iKh(x−Xi)Yi/∑jKh(x−Xj),其中 Kh 为带宽参数为 h 的核函数。在因果推断中,CEF 的非参数估计是估计平均处理效应(ATE)的前置步骤——通过估计 E[Y∣X] 来构建倾向得分或进行回归调整。
CEF 与因果解释的边界
需要特别指出的是,条件期望函数仅描述条件相关性,而非因果效应。即使 E[Y∣X] 随 X 而变,也不能直接解读为 X 引起了 Y 的变化——可能存在遗漏变量、反向因果或选择偏差。从 CEF 到因果推断需要额外的识别条件,如条件独立性假设 Y(0),Y(1)⊥⊥D∣X(其中 D 为处理变量),这正是鲁宾因果模型和倾向得分匹配的理论基础。在自然实验和工具变量法中,研究者利用外生变异来识别 CEF 中的因果参数,这就是结构计量经济学的基本思路。
广义化与相关概念
条件中位数函数(Conditional Median Function)m0.5(x)=Median(Y∣X=x) 是对 CEF 的稳健替代,在分位数回归中通过最小化绝对偏差(L1 损失)来估计。更一般地,条件分位数函数 Qτ(Y∣X) 刻画了 Y 条件分布的各分位点随 X 的变化轨迹,提供了 CEF(τ=0.5 的特殊情况)所无法展现的分布异质性信息。例如,教育回报率在不同收入分位点上的差异可以用分位数回归揭示。
在随机过程理论中,鞅(Martingale)定义为满足 E[Xt+1∣Ft]=Xt 的随机过程——这是 CEF 在时间序列语境中的重要应用。布朗运动和泊松过程等基础随机过程均可构造为鞅或其变形。在金融经济学中,鞅性质是有效市场假说(EMH)的数学基础——在风险中性测度下,折现后的资产价格过程是一个鞅。
在信息经济学中,CEF 刻画了经济主体在给定信息集下的最优预期行为——例如在理性预期(Rational Expectations)假设下,主体对价格的预期等于 E[Pt+1∣It],其中 It 为当前信息集。CEF 因而成为连接微观个体决策与宏观均衡结果的理论桥梁。在贝叶斯统计中,后验均值正是条件期望 E[θ∣X] 在参数估计中的直接应用,其中 θ 为未知参数、X 为观测数据。