知经百科 / Z

最小均方

最小均方 (Least Mean Square)

最小均方(Least Mean Square,LMS)算法是由 WidrowHoff 于 1960 年提出的自适应滤波经典算法,也是随机梯度下降(Stochastic Gradient Descent,SGD)在在线学习中的最早系统应用之一。LMS 以瞬时平方误差替代期望平方误差作为损失函数,每一步沿负梯度方向迭代更新参数,形式极为简洁:wt+1=wt+ηetxt\mathbf{w}_{t+1} = \mathbf{w}_t + \eta e_t \mathbf{x}_t,其中 et=ytwtxte_t = y_t - \mathbf{w}_t^\top \mathbf{x}_t 为预测误差,η\eta 为步长。这种无需存储历史数据、每步仅需 O(d)O(d) 运算的在线特性,使其在经济学的时间序列预测、自适应预期建模和金融计量中具有广泛应用。

算法原理

问题设定

考虑线性观测模型 yt=wxt+εty_t = \mathbf{w}^* \cdot \mathbf{x}_t + \varepsilon_t,其中 xtRd\mathbf{x}_t \in \mathbb{R}^d 为输入向量,yty_t 为标量输出,εt\varepsilon_t 为均值为零的噪声项。目标是在线地估计最优权重 w\mathbf{w}^*,使均方误差(Mean Square Error,MSE)J(w)=E[(ytwxt)2]J(\mathbf{w}) = \mathbb{E}[(y_t - \mathbf{w} \cdot \mathbf{x}_t)^2] 最小化。

随机梯度更新

Batch 梯度下降需要计算完整期望梯度 J(w)=2E[etxt]\nabla J(\mathbf{w}) = -2\mathbb{E}[e_t \mathbf{x}_t],但在线场景下期望不可得。LMS 的核心创新是用瞬时梯度 ^J=2etxt\hat{\nabla} J = -2 e_t \mathbf{x}_t 作为无偏替代,得到更新规则:

wt+1=wt+η(ytwtxt)xt\mathbf{w}_{t+1} = \mathbf{w}_t + \eta (y_t - \mathbf{w}_t^\top \mathbf{x}_t) \mathbf{x}_t

其中 η>0\eta > 0 为步长(学习率)。该规则的经济学直觉与 弗里德曼自适应预期(Adaptive Expectations)假说高度共鸣:决策者根据上一期预测误差成比例地修正本期预期,而 LMS 正是这一思想在高维特征空间中的自然推广。

收敛性

当数据满足平稳性和遍历性条件时,LMS 的权重向量在均方意义下收敛到 维纳 最优解 w=R1p\mathbf{w}^* = \mathbf{R}^{-1} \mathbf{p}(其中 R=E[xtxt]\mathbf{R} = \mathbb{E}[\mathbf{x}_t \mathbf{x}_t^\top]p=E[ytxt]\mathbf{p} = \mathbb{E}[y_t \mathbf{x}_t]),前提是步长满足 0<η<2/λmax(R)0 < \eta < 2 / \lambda_{\max}(\mathbf{R})。收敛速度由 R\mathbf{R} 的特征值散布决定:条件数越大,收敛越慢。步长选择面临经典的探索-利用权衡:大步长加速收敛但增大稳态波动(失调),小步长减小失调但收敛缓慢。

经济学中的应用

自适应预期与学习均衡

LMS 为宏观经济学中的自适应预期提供了微观算法基础。在 EvansHonkapohja (2001) 的适应性学习(Adaptive Learning)框架中,经济主体通过类似 LMS 的递推算法不断更新对通胀、产出等内生变量的预测规则,经济均衡因此被重新解释为学习过程的稳态收敛点。相较于理性预期均衡(REE),适应性学习均衡更贴合现实中经济主体有限认知的约束。

资产定价与波动率预测

高频金融数据中,LMS 及其归一化变体(Normalized LMS, NLMS)被用于实时估计时变 Beta 系数和追踪因子暴露。Tsay (2005) 指出,相比于滚动窗口 OLS,LMS 能更快地捕捉结构性突变(Structural Break),在危机时期的风险管理中尤为关键。

在线计量与实时预测

宏观经济的实时预测(Nowcasting)场景中,数据以混合频率异步到达。LMS 的在线更新能力使其成为 Giannone 等人的动态因子模型(Dynamic Factor Model)之外的计算补充方案,尤其适用于高维替代数据的实时消化——如从新闻文本的 NLP 特征直接预测 PMI。

强化学习与算法博弈

SuttonBarto 的强化学习框架中,LMS 是 TD(λ\lambda) 算法族的基本组件。算法博弈论中的无悔学习(No-Regret Learning)——如 FosterVohra (1999) 的校准预测——其更新规则在代数上也与 LMS 同构。

变体与扩展

  • 归一化 LMS (NLMS)wt+1=wt+ηxt2+δetxt\mathbf{w}_{t+1} = \mathbf{w}_t + \frac{\eta}{\|\mathbf{x}_t\|^2 + \delta} e_t \mathbf{x}_t,通过输入功率归一化消除尺度敏感性,收敛更稳健。
  • 符号-误差 LMS (Sign-Error LMS):仅使用误差的符号 sgn(et) \operatorname{sgn}(e_t) 更新,计算量进一步降低,对脉冲噪声具有鲁棒性。
  • 泄露 LMS (Leaky LMS):引入权重衰减项 wt+1=(1γη)wt+ηetxt\mathbf{w}_{t+1} = (1 - \gamma \eta) \mathbf{w}_t + \eta e_t \mathbf{x}_t,防止权重在非持续激励条件下漂移发散。
  • 仿射投影算法 (APA):在多维约束下同时利用最近的 KK 个数据点更新,在收敛速度与计算复杂度间折中。

局限与批评

LMS 的核心局限有三。其一,固定步长导致的失调-收敛权衡不可消除——即便算法收敛,稳态权重仍会在最优解附近抖动,其方差与 η\eta 成正比。其二,输入相关矩阵 R\mathbf{R} 的条件数敏感:当特征间高度共线时收敛极慢,需搭配白化预处理或改用 NLMS。其三,线性假设的固有局限——当真实数据生成过程非线性时,LMS 收敛到的是最优线性逼近,而非真实结构。对此,核方法(Kernel LMS)和深度网络中的Adam/\SGDM 提供了非线性与自适应步长的替代方案。

尽管如此,作为在线学习的始祖算法,LMS 以其极简形式和广泛适用性,持续影响着从信号处理到经济计量再到现代机器学习的基础研究设计。

返回百科索引