冗余参数
冗余参数(nuisance parameter)又称讨厌参数,是指在统计推断中存在于模型之中、但并非直接感兴趣、却必须加以处理才能对关注参数进行有效推断的模型参数。这一概念贯穿于假设检验、区间估计、点估计和模型选择等多个领域。
定义与基本概念
设统计模型参数为 θ=(ψ,λ),其中 ψ 是关注参数(parameter of interest),λ 是冗余参数(nuisance parameter)。似然函数 L(ψ,λ∣X) 同时依赖于二者,因此必须对 λ 采取策略才能获得关于 ψ 的有效推断。
经典例子:正态分布 N(μ,σ2) 中若关注参数是均值 μ,则方差 σ2 即为冗余参数。线性回归 Y=Xβ+ε 中,若关注参数是 β,则误差方差 σ2 是冗余参数。
处理冗余参数的主要方法
轮廓似然法
对于每个 ψ,在 λ 上最大化似然函数,得到轮廓似然函数:
Lp(ψ∣X)=λmaxL(ψ,λ∣X)=L(ψ,λ^ψ∣X),
其中 λ^ψ 是给定 ψ 下 λ 的最大似然估计。然后基于 Lp(ψ∣X) 对 ψ 推断。轮廓似然的渐近性质与普通似然类似,但小样本下可能存在偏差。
条件似然法
寻找关于 λ 的充分统计量 T,使得给定 T 的条件下样本的条件分布不再依赖于 λ,从而基于条件似然 Lc(ψ∣X,T) 推断 ψ。在指数族分布中特别有效。例如,2×2 列联表中分析优势比时,Fisher精确检验通过固定边际和来消除冗余参数。
边际似然法
在贝叶斯框架下对冗余参数积分:
Lm(ψ∣X)=∫L(ψ,λ∣X)π(λ∣ψ)dλ,
其中 π(λ∣ψ) 是 λ 在 ψ 下的先验分布。
得分检验
拉格朗日乘数检验仅需在原假设下估计模型,即在 ψ=ψ0 约束下估计 λ,避免了对无约束模型的估计。
冗余参数与推断精度
冗余参数的存在会增加关注参数估计的不确定性。以 N(μ,σ2) 为例:σ2 已知时 μ^ 方差为 σ2/n;未知时使用 t 分布,置信区间更宽,反映了估计 σ2 的代价。
从信息论角度,Fisher信息矩阵为:
I(ψ,λ)=(IψψIλψIψλIλλ).
λ 已知时 ψ 的 Fisher 信息量为 Iψψ;λ 未知时有效 Fisher 信息量为 Iψψ−IψλIλλ−1Iλψ,后者总是不大于前者。
面板数据中的冗余参数问题
在面板数据中,个体固定效应 αi 是典型冗余参数。当 T 固定而 N→∞ 时,冗余参数数量随样本量增长,导致偶然参数问题(incidental parameters problem)。固定效应 Logit 模型可通过条件似然消除 αi;线性面板模型则使用组内变换。
与半参数方法的关系
在半参数模型中,冗余参数可能是无穷维的 nuisance function。例如部分线性模型 Y=Xβ+g(Z)+ε 中,β 是有限维关注参数,非参数函数 g(⋅) 是冗余的。需使用非参数方法消除冗余成分,以得到 β 的 n 一致估计量。
参见
参考文献
- Cox, D. R. \& Reid, N. (1987). Parameter orthogonality and approximate conditional inference. JRSS-B, 49(1), 1–39.
- Lehmann, E. L. \& Romano, J. P. (2005). Testing Statistical Hypotheses (3rd ed.). Springer.
- Neyman, J. \& Scott, E. L. (1948). Consistent estimates based on partially consistent observations. Econometrica, 16(1), 1–32.
- Severini, T. A. (2000). Likelihood Methods in Statistics. Oxford University Press.