重期望定律 (Law of Iterated Expectations)
重期望定律(Law of Iterated Expectations,简称 LIE),又称全期望定律(Law of Total Expectation),是概率论和计量经济学中最基础且应用最广泛的定理之一。它揭示了条件期望与无条件期望之间的递推关系:随机变量 Y 的无条件期望等于其关于另一个随机变量 X 的条件期望的期望值。
形式化定义
设 (Ω,F,P) 为概率空间,X 和 Y 为定义于其上的随机变量,且 E[∣Y∣]<∞。重期望定律表述为:
E[Y]=E[E[Y∣X]]
其中内层 E[Y∣X] 是给定 X 下 Y 的条件期望(一个关于 X 的随机变量),外层期望对该随机变量取平均。更一般地,若 G 是 F 的子 σ-代数,则有 E[Y]=E[E[Y∣G]]。
直观解释
重期望定律给出了一种"分步计算"期望的策略:先按 X 的取值将总体划分为若干子群体,在每一子群体内计算 Y 的条件均值 E[Y∣X=x],再将这些条件均值按 X 的分布加权平均:
E[Y]=x∑E[Y∣X=x]⋅P(X=x)(离散情形)
E[Y]=∫−∞∞E[Y∣X=x]⋅fX(x)dx(连续情形)
这一分解的思路在经济学直觉中十分自然:想知道全国平均收入,可以先算每个省份的平均收入,再按各省人口数加权平均——两种路径应得到同一结果。
证明概要
以连续情形为例,设联合密度为 fX,Y(x,y),边缘密度为 fX(x),条件密度为 fY∣X(y∣x):
E[E[Y∣X]]=∫−∞∞(∫−∞∞yfY∣X(y∣x)dy)fX(x)dx=∫−∞∞∫−∞∞yfY∣X(y∣x)fX(x)dydx=∫−∞∞∫−∞∞yfX,Y(x,y)dydx=∫−∞∞y(∫−∞∞fX,Y(x,y)dx)dy=∫−∞∞yfY(y)dy=E[Y]
关键在于条件密度与边缘密度的乘积等于联合密度:fY∣X(y∣x)fX(x)=fX,Y(x,y)。
核心性质与推论
重期望定律衍生出多个重要推论。第一,全方差定律(Law of Total Variance):将方差分解为条件方差的期望与条件期望的方差之和:
Var(Y)=E[Var(Y∣X)]+Var(E[Y∣X])
其中第一项度量"组内变异",第二项度量"组间变异"。这一分解在方差分析(ANOVA)和分层抽样中至关重要。
第二,对任意可测函数 g,有 E[Y⋅g(X)]=E[E[Y∣X]⋅g(X)]。该性质在推导工具变量估计量的大样本性质时频繁使用。
第三,若 E[Y∣X]=0,则 E[Y]=0 且对任意函数 h(X),有 E[Y⋅h(X)]=0。这一正交性条件是线性回归中误差项与解释变量不相关的理论基础。
计量经济学中的应用
重期望定律在计量经济学中无处不在。在普通最小二乘法(OLS)中,一阶条件 E[Xi(Yi−Xi′β)]=0 可通过重期望定律改写为 E{E[Xi(Yi−Xi′β)∣Xi]}=E[Xi⋅0]=0,从而保证无偏性证明的严密性。
在面板数据分析中,固定效应估计量本质上是对组内去均值后的变量应用重期望定律——先用组内变异识别参数,再通过对各组估计量的加权平均得到总体参数。在贝叶斯统计中,后验期望 E[θ∣data] 的无条件期望等于先验期望 E[θ](当数据尚未观测时),这正是重期望定律的直接应用。
在预测理论中,重期望定律保证了条件期望 E[Y∣X] 是均方误差最小的预测函数:对任意预测函数 g(X),E[(Y−E[Y∣X])2]≤E[(Y−g(X))2]。该结果可通过向条件期望中加减 g(X) 并利用重期望定律展开平方完成证明。
扩展与一般化
重期望定律可迭代推广至多个变量的情形。若 (Gt) 为递增的 σ-代数族(即一个滤波),则对 s<t 有:
E[Y∣Gs]=E[E[Y∣Gt]∣Gs]
这是鞅(martingale)理论的支柱性质。在动态规划和随机最优控制中,贝尔曼方程的价值函数迭代正是以此性质为逻辑基础。重期望定律以简洁的形式贯穿概率论、统计学和经济学的理论体系,其"分步取期望"的逻辑既是数学严谨性的保障,也是应用建模中不可或缺的思维工具。