知经百科 / Z

最优设计

最优设计 (Optimal Design)

最优设计(Optimal Design)是指在给定资源约束下,通过优化实验条件(如样本分配、因子水平选择或协变量取值)使参数估计或模型预测的统计效率最大化的方法论。其核心思想源自克拉默-拉奥下界 (Cramér-Rao Lower Bound):估计量的方差由 Fisher 信息矩阵的逆所界定,而 Fisher 信息矩阵依赖于设计变量的选取,因此可以通过选择设计来"塑造"信息矩阵,从而最小化目标估计量的方差。

最优设计广泛应用于计量经济学中的调查抽样设计、临床试验的剂量选择、工业实验的因子配置以及机器学习的主动学习策略。其方法论基础可追溯至 Smith (1918) 对最优多项式回归设计的研究,后经 Kiefer 和 Wolfowitz 在 1960 年代建立公理化框架,成为统计学的一个独立分支。

Fisher 信息矩阵与设计

考虑线性模型 yi=xiβ+εiy_i = \mathbf{x}_i^\top \boldsymbol{\beta} + \varepsilon_i,其中 εiN(0,σ2)\varepsilon_i \sim N(0, \sigma^2) 独立同分布。在给定设计点集合 {xi}i=1n\{\mathbf{x}_i\}_{i=1}^n 下,Fisher 信息矩阵为:

I(β)=1σ2i=1nxixi=nσ2xxξ(dx)\mathbf{I}(\boldsymbol{\beta}) = \frac{1}{\sigma^2} \sum_{i=1}^{n} \mathbf{x}_i \mathbf{x}_i^\top = \frac{n}{\sigma^2} \int \mathbf{x} \mathbf{x}^\top \xi(d\mathbf{x})

其中 ξ\xi 是设计测度,表示各设计点的权重分布。最优设计的任务就是在某种准则 Φ()\Phi(\cdot) 下选择 ξ\xi 以最小化 Φ(I1)\Phi(\mathbf{I}^{-1})——即最小化参数估计量的某种"大小"。经典的连续最优设计理论(Kiefer-Wolfowitz)将离散设计推广到连续概率测度空间,利用凸分析和等价性定理给出最优设计的刻画条件。连续设计的优势在于:信息矩阵在概率测度空间上是凹函数,从而最优设计的存在性和唯一性可由凸分析工具严格保证,且可通过方向导数刻画出最优性的必要充分条件。

以简单线性回归 y=β0+β1x+εy = \beta_0 + \beta_1 x + \varepsilon 为例,若设计空间为 x[1,1]x \in [-1, 1],D-最优设计将一半观测置于 x=1x = -1、另一半置于 x=1x = 1——直觉上,将设计点尽可能分散在边界上能最大化斜率估计的精度。若设计空间不对称(如 x[0,1]x \in [0, 1]),则 D-最优设计将部分观测置于 x=0x = 0、其余置于 x=1x = 1,视模型是否含截距而定比例。

主要最优性准则

设信息矩阵为 M=I(β)\mathbf{M} = \mathbf{I}(\boldsymbol{\beta}),常用最优性准则 Φ(M1)\Phi(\mathbf{M}^{-1}) 定义如下:

  • D-最优(D-Optimal):最大化 det(M)\det(\mathbf{M}),等价于最小化 det(M1)\det(\mathbf{M}^{-1})。D-最优设计最小化了参数联合置信椭球的体积,是最常用的准则。在正态线性模型下,D-最优等价于最小化广义方差。
  • A-最优(A-Optimal):最小化 tr(M1)\operatorname{tr}(\mathbf{M}^{-1}),即最小化参数估计量的平均方差。A-最优适用于对各参数估计精度赋予相等权重的场景。
  • E-最优(E-Optimal):最小化 M1\mathbf{M}^{-1} 的最大特征值 λmax(M1)\lambda_{\max}(\mathbf{M}^{-1}),即最小化最差方向上的方差。E-最优具有极小极大性质。
  • G-最优(G-Optimal):最小化设计空间上的最大预测方差 maxxXxM1x\max_{\mathbf{x} \in \mathcal{X}} \mathbf{x}^\top \mathbf{M}^{-1} \mathbf{x}。Kiefer-Wolfowitz 等价性定理证明,D-最优与 G-最优在连续设计下等价。
  • I-最优(I-Optimal,也称 V-最优):最小化设计空间上的平均预测方差 XxM1xμ(dx)\int_{\mathcal{X}} \mathbf{x}^\top \mathbf{M}^{-1} \mathbf{x} \, \mu(d\mathbf{x}),适用于以精确预测为主要目标的场景。
  • c-最优(c-Optimal):对特定线性组合 cβ\mathbf{c}^\top \boldsymbol{\beta} 最小化其估计方差 cM1c\mathbf{c}^\top \mathbf{M}^{-1} \mathbf{c},适用于只需精确估计某个特定对比或处理效应的场景。

等价性定理

Kiefer-Wolfowitz 等价性定理是最优设计理论的核心结果。该定理断言,对于连续设计 ξ\xi^*,以下三个命题等价:(1) ξ\xi^* 是 D-最优设计;(2) ξ\xi^* 是 G-最优设计;(3) 对设计空间中所有 x\mathbf{x},有 xM1(ξ)xp\mathbf{x}^\top \mathbf{M}^{-1}(\xi^*) \mathbf{x} \leq p(其中 pp 为参数维度),等号在 ξ\xi^* 的支撑点上成立。这一定理不仅连接了参数估计精度与预测精度,还提供了验证设计最优性的实用检验:只需检查标准化预测方差函数是否在设计空间上不超过参数个数。

构造算法

实际构造最优设计通常依赖数值算法:

  • Fedorov 交换算法:从一个非奇异初始设计出发,每次迭代将一个设计点与候选集中使准则函数增益最大的点进行交换,逐步收敛至最优设计。
  • 乘法算法(Multiplicative Algorithm):对设计权重进行迭代更新,wi(t+1)wi(t)d(xi,ξ(t))w_i^{(t+1)} \propto w_i^{(t)} \cdot d(\mathbf{x}_i, \xi^{(t)}),其中 dd 是设计点对当前设计的方向导数。该算法保证收敛且支持高维设计空间。
  • 坐标交换算法(Coordinate Exchange):对设计矩阵的每个元素依次进行一维优化,适用于离散因子和约束设计区域。

非线性模型中的最优设计

非线性回归模型中,信息矩阵本身依赖于未知参数 θ\boldsymbol{\theta}M(ξ,θ)\mathbf{M}(\xi, \boldsymbol{\theta})。此时最优设计依赖于待估参数的真实值,形成循环依赖。处理方法包括:(1) 局部最优设计:在参数的先验猜测值上优化,得到局部最优设计;(2) 贝叶斯最优设计:对参数引入先验分布 π(θ)\pi(\boldsymbol{\theta}),最大化期望准则 Φ(M(ξ,θ))π(dθ)\int \Phi(\mathbf{M}(\xi, \boldsymbol{\theta})) \, \pi(d\boldsymbol{\theta});(3) 极小极大设计:在参数的不确定性集合上最小化最坏情况损失;(4) 序贯设计:分阶段进行,每阶段利用之前积累的数据更新参数估计并调整后续设计。

与计量经济学的联系

计量经济学中,最优设计思想贯穿多个领域。在工具变量 (IV)估计中,弱工具变量问题可通过选择与内生变量相关性最强的工具来缓解——本质上是 c-最优设计的应用。在政策评估的随机对照试验(RCT)中,样本在不同处理组之间的最优分配(如 Neyman 分配)可被视为离散设计空间下的 A-最优设计。在断点回归设计中,带宽选择涉及估计精度与偏差的权衡,是设计选择问题的非参数推广。在选择实验(Choice Experiment)和联合分析(Conjoint Analysis)中,属性水平和选择集的构造直接影响支付意愿估计的效率,D-最优和 Bayesian 最优设计被广泛用于生成高效的选择任务组合。

此外,在面板数据模型中,追踪轮次的时间间隔设计影响对动态参数的识别精度;在空间计量经济学中,观测点的空间布局影响空间自相关参数的估计效率。这些均可统一纳入最优设计框架加以分析。

最优设计的核心洞见在于:统计效率不仅是估计方法的选择问题,更是数据收集方式的选择问题。主动而审慎地设计实验,往往能以更少的样本获得更精确的推断。这一思想与信息经济学

返回百科索引