知经百科 / Z

最小二乘均值

最小二乘均值(LS Mean):在非均衡设计中恢复公平比较

最小二乘均值(Least Squares Mean,简称 LS Mean 或 LS 均值)是统计学家哈维(Walter Harvey)亨德森(Charles Henderson)等人在 20 世纪 50 至 60 年代为处理非均衡数据(unbalanced data)而提出的概念。在农业、生物学、医学和社会科学等领域的实验或观察研究中,各组样本量往往不相等——例如,某药物的治疗组有 50 人而对照组仅有 30 人——此时直接比较各组样本均值(arithmetic mean)会引入混杂偏差,因为各组在协变量(如年龄、性别、基线指标)上的分布可能系统性不同。LS 均值通过在线性模型框架下预测各组的边际均值,将协变量调整到相同的参照水平,从而实现"公平比较"。

从样本均值到模型预测均值

在均衡设计(各组样本量相等且协变量分布相同)中,样本均值与 LS 均值完全一致。但当设计非均衡时,二者的差异至关重要。

考虑一个包含 kk 个处理组和一个连续协变量 xx协方差分析(ANCOVA)模型:

yij=μ+αi+β(xijxˉ)+εij,i=1,,k;  j=1,,niy_{ij} = \mu + \alpha_i + \beta (x_{ij} - \bar{x}_{\cdot\cdot}) + \varepsilon_{ij}, \quad i = 1,\dots,k;\; j = 1,\dots,n_i

其中 yijy_{ij} 是第 ii 组的第 jj 个观测值,αi\alpha_i 是第 ii 组的处理效应,β\beta 是协变量的回归系数,xˉ\bar{x}_{\cdot\cdot} 是所有观测协变量的总体均值,εijN(0,σ2)\varepsilon_{ij} \sim N(0,\sigma^2)。第 ii 组的 LS 均值定义为:

LS Meani=μ^+α^i\text{LS Mean}_i = \hat{\mu} + \hat{\alpha}_i

它是在协变量取总体均值(即 x=xˉx = \bar{x}_{\cdot\cdot})时模型对第 ii 组因变量的预测值。相比之下,第 ii 组的样本均值 yˉi\bar{y}_{i\cdot} 是原始数据的简单平均,当各组的协变量均值 xˉi\bar{x}_{i\cdot} 与总体均值 xˉ\bar{x}_{\cdot\cdot} 不一致时,样本均值中混杂了协变量差异的影响。

数学推导:预测视角下的定义

更一般地,LS 均值可以通过线性模型的预测矩阵统一表述。设模型为 y=Xβ+ε\mathbf{y} = \mathbf{X}\boldsymbol{\beta} + \boldsymbol{\varepsilon},其中 X\mathbf{X} 是设计矩阵(包含处理因子、协变量以及可能的交互项),β\boldsymbol{\beta} 是系数向量。对于待估的某个因子水平组合 ii,构造对照矩阵(contrast matrix)Li\mathbf{L}_i,使得 Liβ\mathbf{L}_i\boldsymbol{\beta} 给出该水平组合在参照协变量条件下的期望响应。LS 均值即为:

LS Meani=Liβ^\text{LS Mean}_i = \mathbf{L}_i \hat{\boldsymbol{\beta}}

其方差为:

Var(LS Meani)=LiVar(β^)Li=σ2Li(XX)1Li\text{Var}(\text{LS Mean}_i) = \mathbf{L}_i \text{Var}(\hat{\boldsymbol{\beta}}) \mathbf{L}_i^{\top} = \sigma^2 \mathbf{L}_i (\mathbf{X}^{\top}\mathbf{X})^{-1} \mathbf{L}_i^{\top}

在 SAS 的 PROC GLM、PROC MIXED 以及 R 的 \texttt{emmeans} 包中,LS 均值的计算均遵循这一框架。当模型中包含交互项时,LS 均值会按照"等权重"原则对各交互水平进行平均,而不是按实际样本量加权——这正是其与总体边际均值(population marginal mean)等价的原因。

为什么需要 LS 均值:三个典型场景

场景一:临床试验中的基线调整。在一项降压药试验中,治疗组和对照组的基线收缩压均值分别为 145 mmHg 和 138 mmHg。直接比较治疗后血压的组均值会高估药效,因为治疗组起点更高,即使无药效也可能因均值回归而出现更大的下降。LS 均值将两组基线血压调整到同一水平(如总体均值 141.5 mmHg),从而分离出处理组的净效应。

场景二:教育研究中的协变量不平衡。比较两种教学法对考试成绩的影响时,实验班学生的学习时长和家庭背景可能与对照班系统性不同。通过将学时时长、父母受教育年限等协变量纳入 ANCOVA 模型,LS 均值给出了"若两班学生协变量相同"时的期望成绩差异。

场景三:农业试验中的缺失数据。在品种比较试验中,因气候或土地条件导致某些品种的重复数不等。LS 均值利用所有可用的数据信息,在模型框架下对各品种的产量进行均衡估计,避免了因样本量不等而导致的估计偏差。

LS 均值与样本均值的区别总结

  • 样本均值yˉi=1nij=1niyij\bar{y}_{i\cdot} = \frac{1}{n_i}\sum_{j=1}^{n_i} y_{ij},仅使用第 ii 组数据,不对协变量进行调整。
  • LS 均值:基于模型预测,将协变量固定在总体均值上,考虑了所有组的信息(协变量系数的估计借用了全样本)。在均衡设计中二者相等;在非均衡设计中 LS 均值是更公正的比较基准。

软件实现与注意事项

在主流统计软件中,LS 均值的计算均有便捷的实现:

  • SAS:通过 \texttt{LSMEANS} 语句实现,如 \texttt{PROC GLM; CLASS trt; MODEL y = trt x; LSMEANS trt / PDIFF;}。
  • R:最常用的是 \texttt{emmeans} 包(Estimated Marginal Means),如 \texttt{emmeans(model, "trt")}。
  • Python:\texttt{statsmodels} 中可使用 \texttt{margins} 或 \texttt{from\_formula} 结合预测方法计算。
  • Stata:的 \texttt{margins} 命令直接提供边际均值的计算和比较。

注意事项包括:第一,LS 均值的有效性依赖于模型的正确设定——如果模型遗漏了重要的交互项或非线性项,LS 均值可能会产生误导。第二,当协变量的组间分布存在严重不重叠(缺乏共同支撑)时,LS 均值的含义需要谨慎解释,因为它本质上是模型外推的结果。第三,LS 均值提供的是"公平比较",但未必对应任何实际可观察的子总体——它是一种反事实推断,而非描述性统计。

历史渊源与拓展

最小二乘均值这一概念的提出与线性模型理论的成熟密切相关。哈维(1960)在其经典论文《Least-Squares Analysis of Data with Unequal Subclass Numbers》中系统阐述了非均衡数据的分析方法。随后,西尔(Searle, 1971)在《Linear Models》中给出了严格的数学定义。拉塞尔·伦特(Russell Lenth, 2016)开发的 \texttt{emmeans} 包将这一思想推广到广义线性模型(GLM)、混合模型(Mixed Models)和生存分析模型(Survival Models)中,统称为"估计边际均值"(Estimated Marginal Means, EMMs),使得 LS 均值的思想在现代统计实践中获得了空前广泛的应用。

在复杂的实验设计中——如含随机效应的混合模型、含多次测量的重复测量设计、含缺失数据的纵向研究——LS 均值(EMMs)几乎是进行组间比较的唯一标准方法,被广泛应用于药物临床试验的统计报告、生物等效性评价和社会科学的元分析等关键领域。

此外,LS 均值的思想还延伸到了广义线性模型框架中。在逻辑回归、泊松回归等非正态响应模型中,估计边际均值在响应尺度(概率、计数)和链接函数尺度(logit、log)上均可计算,为分类数据和计数数据的组间比较提供了统一的方法论。这使得 LS 均值的应用进一步拓展到了流行病学中的风险比估计、市场研究中的转化率对比以及生态学中的物种丰度比较等多个新兴领域,成为连接经典线性模型与现代统计方法的重要桥梁。

返回百科索引