知经百科 / Y

样本方差 (Sample Variance)

样本方差 (Sample Variance)

样本方差 (Sample Variance) 是描述统计推断统计中最核心的离散程度度量之一。它量化了一组样本数据围绕其样本均值的离散或散布程度,是总体方差 σ2 \sigma^2 的一个样本估计量。样本方差在假设检验置信区间构造、线性回归分析以及方差分析 (ANOVA) 中都具有不可替代的地位。与极差四分位距等离散度量不同,样本方差利用了全部数据信息,是衡量数据变异性的最常用指标。

定义与公式

给定一个从总体中抽取的容量为 n n 随机样本 {X1,X2,,Xn} \{X_1, X_2, \dots, X_n\} ,样本方差通常有两种定义形式。

有偏样本方差定义为:

Sn2=1ni=1n(XiXˉ)2S_n^2 = \frac{1}{n} \sum_{i=1}^{n} (X_i - \bar{X})^2

其中 Xˉ=1ni=1nXi \bar{X} = \frac{1}{n}\sum_{i=1}^n X_i 是样本均值。该估计量的期望值为 E[Sn2]=n1nσ2 E[S_n^2] = \frac{n-1}{n}\sigma^2 ,这说明 Sn2 S_n^2 存在向下偏误——它系统性地低估总体方差。当样本量 n n 很小时,这种偏误尤为明显;随着 n n 增大,偏误逐渐消失。

无偏样本方差(最常用形式)定义为:

s2=1n1i=1n(XiXˉ)2s^2 = \frac{1}{n-1} \sum_{i=1}^{n} (X_i - \bar{X})^2

这是实际应用中最广泛采用的样本方差定义。分母使用 n1 n-1 而非 n n ,使得 E[s2]=σ2 E[s^2] = \sigma^2 ,即 s2 s^2 是总体方差的一个无偏估计量。下文除非特别说明,"样本方差"均指此形式。

在计算机编程中,常使用等价的计算公式以避免两次遍历数据:

s2=1n1[i=1nXi21n(i=1nXi)2]s^2 = \frac{1}{n-1} \left[ \sum_{i=1}^{n} X_i^2 - \frac{1}{n}\left(\sum_{i=1}^{n} X_i\right)^2 \right]

该公式仅需单次遍历即可同时累加 Xi \sum X_i Xi2 \sum X_i^2 ,在数值计算中效率更高,但也可能因大数减小数而损失精度,故在要求高精度时推荐使用韦尔福德算法 (Welford's Algorithm) 等增量式算法。

自由度与贝塞尔校正

分母中的 n1 n-1 被称为自由度 (Degrees of Freedom)。为什么是 n1 n-1 而不是 n n ?核心原因在于,计算样本方差时使用了样本均值 Xˉ \bar{X} 来代替未知的总体均值 μ \mu ,而 Xˉ \bar{X} 本身是从同一组数据中计算出来的,这消耗了一个线性约束。具体来说,n n 个离差 (XiXˉ) (X_i - \bar{X}) 满足 i=1n(XiXˉ)=0 \sum_{i=1}^n (X_i - \bar{X}) = 0 ,一旦知道其中 n1 n-1 个离差,第 n n 个就被唯一确定。因此,真正独立的信息量只有 n1 n-1 ,"分摊"方差时也理应除以 n1 n-1 。这种分母修正被称为贝塞尔校正 (Bessel's Correction),以纪念德国天文学家弗里德里希·贝塞尔,他最早在误差分析中引入了这一修正。

从几何角度看,样本均值 Xˉ \bar{X} 比总体均值 μ \mu 更"贴合"样本数据——Xˉ \bar{X} 最小化了 (Xic)2 \sum (X_i - c)^2 。以 Xˉ \bar{X} 为中心计算的离差平方和必然小于以 μ \mu 为中心的值。除以 n1 n-1 正好补偿了这种天然"缩水",确保估计量的无偏性。这一修正的思想在统计学中具有普遍意义:每使用数据估计一个参数,就会消耗一个自由度。

统计性质

无偏性s2 s^2 σ2 \sigma^2 的一个无偏估计量,满足 E[s2]=σ2 E[s^2] = \sigma^2 。这是样本方差替代有偏版本的根本原因。

与卡方分布的关系:如果样本来自一个正态分布 N(μ,σ2) N(\mu, \sigma^2) ,则样本方差与总体方差之比乘以自由度服从卡方分布

(n1)s2σ2χ2(n1)\frac{(n-1)s^2}{\sigma^2} \sim \chi^2(n-1)

这一结论是推导总体方差置信区间和进行方差类假设检验(如F检验Bartlett检验Levene检验)的数学基础。具体而言,总体方差 100(1α)% 100(1-\alpha)\% 置信区间为:

[(n1)s2χα/22(n1),  (n1)s2χ1α/22(n1)]\left[ \frac{(n-1)s^2}{\chi^2_{\alpha/2}(n-1)},\; \frac{(n-1)s^2}{\chi^2_{1-\alpha/2}(n-1)} \right]

一致性s2 s^2 σ2 \sigma^2 的一个一致估计量:随着样本量 n n \to \infty s2 s^2 依概率收敛于 σ2 \sigma^2 。有偏版本 Sn2 S_n^2 也是一致估计量,因为 n n \to \infty n1n1 \frac{n-1}{n} \to 1 ,二者差异渐近消失。

渐近正态性:在大样本下,样本方差的抽样分布近似正态分布:

n(s2σ2)dN(0,μ4σ4)\sqrt{n}(s^2 - \sigma^2) \xrightarrow{d} N(0, \mu_4 - \sigma^4)

其中 μ4 \mu_4 是总体的四阶中心矩。这一性质为无需正态假设的大样本推断提供了理论基础。

样本标准差

样本方差的平方根称为样本标准差 (Sample Standard Deviation),记为 s=s2 s = \sqrt{s^2} 。即使 s2 s^2 σ2 \sigma^2 的无偏估计量,s s 通常并不是 σ \sigma 的无偏估计量——这是平方根非线性变换导致的詹森不等式效应。但在实践中,s s 被广泛用作 σ \sigma 的估计量,因为其与原始数据同单位,更便于直观解读。

在回归分析中的应用

普通最小二乘法 (OLS) 回归中,样本方差的概念贯穿始终。

误差方差估计:OLS 误差项方差 σu2 \sigma^2_u 的标准无偏估计量为:

σ^u2=i=1nu^i2nk1=RSSnk1\hat{\sigma}_u^2 = \frac{\sum_{i=1}^{n} \hat{u}_i^2}{n - k - 1} = \frac{\text{RSS}}{n - k - 1}

其中 u^i \hat{u}_i 是回归残差,k k 是解释变量个数,nk1 n-k-1 是残差的自由度。分母正是样本方差思想的推广——每估计一个回归系数就消耗一个自由度。

标准误:回归系数的标准误 (Standard Error) 直接包含 σ^u2 \hat{\sigma}_u^2

se(β^j)=σ^u2SSTj(1Rj2)\text{se}(\hat{\beta}_j) = \sqrt{\frac{\hat{\sigma}_u^2}{\text{SST}_j \cdot (1 - R_j^2)}}

标准误是进行t检验和构造置信区间的关键输入。标准误越小,参数估计的精度越高。

拟合优度决定系数 R2=1RSSTSS R^2 = 1 - \frac{\text{RSS}}{\text{TSS}} 中,分母 TSS(总离差平方和)等于 (n1)sy2 (n-1) \cdot s_y^2 ,其中 sy2 s_y^2 是因变量的样本方差。样本方差直接参与衡量模型解释力。

在假设检验中的应用

样本方差是多种假设检验的核心统计量。在单样本方差检验中,检验统计量 χ2=(n1)s2/σ02 \chi^2 = (n-1)s^2/\sigma_0^2 用于判断总体方差是否等于某特定值 σ02 \sigma_0^2 。在两样本方差比较中,F=s12/s22 F = s_1^2/s_2^2 服从 F 分布,用于检验两个总体方差是否相等。在方差分析 (ANOVA) 中,组内均方 (MSE) 本质上就是合并样本方差,组间均方 (MST) 则反映了各样本均值的变异性,二者的比值构成 F 统计量。

样本方差与总体方差的比较

总体方差 σ2 \sigma^2 是固定参数,以总体均值 μ \mu 为中心,分母为总体容量 N N 。样本方差 s2 s^2 是随机变量(统计量),以样本均值 Xˉ \bar{X} 为中心,分母为 n1 n-1 。总体方差通常未知,而样本方差可直接从数据计算获得。在大数定律下,样本方差依概率收敛于总体方差。

合并样本方差

当比较两个总体均值时(如独立双样本t检验),若假定两个总体方差相等,则使用合并样本方差 (Pooled Sample Variance) 来估计共同的总体方差:

sp2=(n11)s12+(n21)s22n1+n22s_p^2 = \frac{(n_1-1)s_1^2 + (n_2-1)s_2^2}{n_1 + n_2 - 2}

这是两个样本方差的加权平均,权重为各自的自由度。合并方差充分使用了两组样本的全部信息,是双样本推断中误差方差的最优无偏估计量。

注意事项

第一,样本方差对异常值 (Outliers) 高度敏感。由于离差被平方,极端值会对方差产生不成比例的巨大影响。在存在严重异常值时,可考虑使用四分位距 (IQR) 或中位数绝对离差 (MAD) 等稳健度量代替。

第二,方差的单位是原始数据单位的平方,这有时不便解读。样本标准差 s s 与原始数据同单位,在描述分析中更为直观。在描述数据时应同时报告均值与标准差。

第三,上述性质(无偏性、卡方分布关系等)均依赖于独立同分布 (i.i.d.) 假设。当数据存在自相关异方差性时,标准样本方差可能不再具有良好性质,需要使用异方差自相关稳健标准误 (HAC) 或聚类稳健标准误等方法加以调整。

返回百科索引