样本方差 (Sample Variance)
样本方差 (Sample Variance) 是描述统计和推断统计中最核心的离散程度度量之一。它量化了一组样本数据围绕其样本均值的离散或散布程度,是总体方差 σ2 的一个样本估计量。样本方差在假设检验、置信区间构造、线性回归分析以及方差分析 (ANOVA) 中都具有不可替代的地位。与极差、四分位距等离散度量不同,样本方差利用了全部数据信息,是衡量数据变异性的最常用指标。
定义与公式
给定一个从总体中抽取的容量为 n 的随机样本 {X1,X2,…,Xn},样本方差通常有两种定义形式。
有偏样本方差定义为:
Sn2=n1i=1∑n(Xi−Xˉ)2
其中 Xˉ=n1∑i=1nXi 是样本均值。该估计量的期望值为 E[Sn2]=nn−1σ2,这说明 Sn2 存在向下偏误——它系统性地低估总体方差。当样本量 n 很小时,这种偏误尤为明显;随着 n 增大,偏误逐渐消失。
无偏样本方差(最常用形式)定义为:
s2=n−11i=1∑n(Xi−Xˉ)2
这是实际应用中最广泛采用的样本方差定义。分母使用 n−1 而非 n,使得 E[s2]=σ2,即 s2 是总体方差的一个无偏估计量。下文除非特别说明,"样本方差"均指此形式。
在计算机编程中,常使用等价的计算公式以避免两次遍历数据:
s2=n−11i=1∑nXi2−n1(i=1∑nXi)2
该公式仅需单次遍历即可同时累加 ∑Xi 和 ∑Xi2,在数值计算中效率更高,但也可能因大数减小数而损失精度,故在要求高精度时推荐使用韦尔福德算法 (Welford's Algorithm) 等增量式算法。
自由度与贝塞尔校正
分母中的 n−1 被称为自由度 (Degrees of Freedom)。为什么是 n−1 而不是 n?核心原因在于,计算样本方差时使用了样本均值 Xˉ 来代替未知的总体均值 μ,而 Xˉ 本身是从同一组数据中计算出来的,这消耗了一个线性约束。具体来说,n 个离差 (Xi−Xˉ) 满足 ∑i=1n(Xi−Xˉ)=0,一旦知道其中 n−1 个离差,第 n 个就被唯一确定。因此,真正独立的信息量只有 n−1,"分摊"方差时也理应除以 n−1。这种分母修正被称为贝塞尔校正 (Bessel's Correction),以纪念德国天文学家弗里德里希·贝塞尔,他最早在误差分析中引入了这一修正。
从几何角度看,样本均值 Xˉ 比总体均值 μ 更"贴合"样本数据——Xˉ 最小化了 ∑(Xi−c)2。以 Xˉ 为中心计算的离差平方和必然小于以 μ 为中心的值。除以 n−1 正好补偿了这种天然"缩水",确保估计量的无偏性。这一修正的思想在统计学中具有普遍意义:每使用数据估计一个参数,就会消耗一个自由度。
统计性质
无偏性:s2 是 σ2 的一个无偏估计量,满足 E[s2]=σ2。这是样本方差替代有偏版本的根本原因。
与卡方分布的关系:如果样本来自一个正态分布 N(μ,σ2),则样本方差与总体方差之比乘以自由度服从卡方分布:
σ2(n−1)s2∼χ2(n−1)
这一结论是推导总体方差置信区间和进行方差类假设检验(如F检验、Bartlett检验、Levene检验)的数学基础。具体而言,总体方差 100(1−α)% 置信区间为:
[χα/22(n−1)(n−1)s2,χ1−α/22(n−1)(n−1)s2]
一致性:s2 是 σ2 的一个一致估计量:随着样本量 n→∞,s2 依概率收敛于 σ2。有偏版本 Sn2 也是一致估计量,因为 n→∞ 时 nn−1→1,二者差异渐近消失。
渐近正态性:在大样本下,样本方差的抽样分布近似正态分布:
n(s2−σ2)dN(0,μ4−σ4)
其中 μ4 是总体的四阶中心矩。这一性质为无需正态假设的大样本推断提供了理论基础。
样本标准差
样本方差的平方根称为样本标准差 (Sample Standard Deviation),记为 s=s2。即使 s2 是 σ2 的无偏估计量,s 通常并不是 σ 的无偏估计量——这是平方根非线性变换导致的詹森不等式效应。但在实践中,s 被广泛用作 σ 的估计量,因为其与原始数据同单位,更便于直观解读。
在回归分析中的应用
在普通最小二乘法 (OLS) 回归中,样本方差的概念贯穿始终。
误差方差估计:OLS 误差项方差 σu2 的标准无偏估计量为:
σ^u2=n−k−1∑i=1nu^i2=n−k−1RSS
其中 u^i 是回归残差,k 是解释变量个数,n−k−1 是残差的自由度。分母正是样本方差思想的推广——每估计一个回归系数就消耗一个自由度。
标准误:回归系数的标准误 (Standard Error) 直接包含 σ^u2:
se(β^j)=SSTj⋅(1−Rj2)σ^u2
标准误是进行t检验和构造置信区间的关键输入。标准误越小,参数估计的精度越高。
拟合优度:决定系数 R2=1−TSSRSS 中,分母 TSS(总离差平方和)等于 (n−1)⋅sy2,其中 sy2 是因变量的样本方差。样本方差直接参与衡量模型解释力。
在假设检验中的应用
样本方差是多种假设检验的核心统计量。在单样本方差检验中,检验统计量 χ2=(n−1)s2/σ02 用于判断总体方差是否等于某特定值 σ02。在两样本方差比较中,F=s12/s22 服从 F 分布,用于检验两个总体方差是否相等。在方差分析 (ANOVA) 中,组内均方 (MSE) 本质上就是合并样本方差,组间均方 (MST) 则反映了各样本均值的变异性,二者的比值构成 F 统计量。
样本方差与总体方差的比较
总体方差 σ2 是固定参数,以总体均值 μ 为中心,分母为总体容量 N。样本方差 s2 是随机变量(统计量),以样本均值 Xˉ 为中心,分母为 n−1。总体方差通常未知,而样本方差可直接从数据计算获得。在大数定律下,样本方差依概率收敛于总体方差。
合并样本方差
当比较两个总体均值时(如独立双样本t检验),若假定两个总体方差相等,则使用合并样本方差 (Pooled Sample Variance) 来估计共同的总体方差:
sp2=n1+n2−2(n1−1)s12+(n2−1)s22
这是两个样本方差的加权平均,权重为各自的自由度。合并方差充分使用了两组样本的全部信息,是双样本推断中误差方差的最优无偏估计量。
注意事项
第一,样本方差对异常值 (Outliers) 高度敏感。由于离差被平方,极端值会对方差产生不成比例的巨大影响。在存在严重异常值时,可考虑使用四分位距 (IQR) 或中位数绝对离差 (MAD) 等稳健度量代替。
第二,方差的单位是原始数据单位的平方,这有时不便解读。样本标准差 s 与原始数据同单位,在描述分析中更为直观。在描述数据时应同时报告均值与标准差。
第三,上述性质(无偏性、卡方分布关系等)均依赖于独立同分布 (i.i.d.) 假设。当数据存在自相关或异方差性时,标准样本方差可能不再具有良好性质,需要使用异方差自相关稳健标准误 (HAC) 或聚类稳健标准误等方法加以调整。