知经百科 / Y

样本二阶中心矩

%% id: 3527 %% word: "样本二阶中心矩" %% created_model: "google/gemini-2.5-pro" %% verified: true %% created_by_id: 1 %% view_counts: 0 %% inserted_at: "2025-10-26T00:14:01" %% updated_at: "2025-10-26T00:14:01"

样本二阶中心矩

定义

X1,X2,,Xn X_1, X_2, \dots, X_n 为一组样本,样本二阶中心矩(Sample Second Central Moment)定义为:

m2=1ni=1n(XiXˉ)2m_2 = \frac{1}{n}\sum_{i=1}^{n}(X_i - \bar{X})^2

其中 Xˉ=1ni=1nXi \bar{X} = \frac{1}{n}\sum_{i=1}^{n}X_i 为样本均值。它是总体二阶中心矩 μ2=E[(Xμ)2] \mu_2 = E[(X - \mu)^2] 的直接样本对应量。

与样本方差的关系

样本方差 S2 S^2 定义为:

S2=1n1i=1n(XiXˉ)2S^2 = \frac{1}{n-1}\sum_{i=1}^{n}(X_i - \bar{X})^2

两者仅相差一个因子:

m2=n1nS2,S2=nn1m2m_2 = \frac{n-1}{n}S^2, \quad S^2 = \frac{n}{n-1}m_2
  • m2 m_2 是矩法估计量,使用分母 n n
  • S2 S^2 无偏估计量,使用分母 n1 n-1 (贝塞尔校正)。

性质

  1. 非负性m20 m_2 \geq 0 ,当且仅当所有 Xi=Xˉ X_i = \bar{X} 时取等。
  2. 有偏性E[m2]=n1nσ2σ2 E[m_2] = \frac{n-1}{n}\sigma^2 \neq \sigma^2 ,故为有偏估计。
  3. 渐近无偏性limnE[m2]=σ2 \lim_{n\to\infty} E[m_2] = \sigma^2 ,大样本下偏差可忽略。
  4. 可计算形式
m2=1ni=1nXi2Xˉ2 m_2 = \frac{1}{n}\sum_{i=1}^{n}X_i^2 - \bar{X}^2

该表达式避免了中心化后的再次遍历,便于编程实现。

  1. 对平移不变性:对任意常数 c c ,有 m2(X1+c,,Xn+c)=m2(X1,,Xn) m_2(X_1+c,\dots,X_n+c) = m_2(X_1,\dots,X_n)
  2. 对缩放的非线性响应m2(cX1,,cXn)=c2m2(X1,,Xn) m_2(cX_1,\dots,cX_n) = c^2 m_2(X_1,\dots,X_n)

与总体矩的对应关系

概念总体样本
一阶原点矩(均值)μ=E[X] \mu = E[X] Xˉ=1nXi \bar{X} = \frac{1}{n}\sum X_i
二阶中心矩(方差)σ2=E[(Xμ)2] \sigma^2 = E[(X-\mu)^2] m2=1n(XiXˉ)2 m_2 = \frac{1}{n}\sum (X_i-\bar{X})^2

矩估计框架下的地位

在矩估计(Method of Moments)框架中,m2 m_2 是总体方差 σ2 \sigma^2 的矩估计量。矩估计的核心思想是"用样本矩代替总体矩":

  1. 令样本二阶中心矩 = 总体二阶中心矩;
  2. 解得参数估计量。

例如,对正态分布 N(μ,σ2) N(\mu, \sigma^2) ,矩估计为 μ^=Xˉ \hat{\mu} = \bar{X} σ^2=m2 \hat{\sigma}^2 = m_2

自由度视角

m2 m_2 的分母取 n n 而非 n1 n-1 ,原因在于矩法不进行自由度校正。在计算 (XiXˉ) (X_i - \bar{X}) 时,样本需满足一个线性约束 (XiXˉ)=0 \sum (X_i - \bar{X}) = 0 ,相当于损失了一个自由度,因此 m2 m_2 是对方差的有偏估计。

应用场景

  1. 描述统计:直接反映数据的离散程度,单位与原始数据平方一致。
  2. 矩估计:作为总体方差的矩法估计量。
  3. 主成分分析(PCA):协方差矩阵(或相关系数矩阵)的对角线元素即为各变量的样本二阶中心矩。
  4. 高阶矩计算:样本 k k 阶中心矩的一般形式为 mk=1n(XiXˉ)k m_k = \frac{1}{n}\sum (X_i - \bar{X})^k m2 m_2 是最基础的高阶中心矩。
  5. 假设检验:在构造某些检验统计量(如 Jarque-Bera 检验)时,二阶中心矩是计算偏度和峰度的基础。

计算示例

设有样本 {2,4,6,8} \{2, 4, 6, 8\}

  1. Xˉ=2+4+6+84=5 \bar{X} = \frac{2+4+6+8}{4} = 5
  2. m2=14[(25)2+(45)2+(65)2+(85)2]=14[9+1+1+9]=5 m_2 = \frac{1}{4}[(2-5)^2 + (4-5)^2 + (6-5)^2 + (8-5)^2] = \frac{1}{4}[9+1+1+9] = 5

样本方差 S2=43×56.67 S^2 = \frac{4}{3} \times 5 \approx 6.67 ,验证了 S2>m2 S^2 > m_2 的关系。

与样本标准差的关系

样本标准差的无偏估计通常使用 S=S2 S = \sqrt{S^2} ,而非 m2 \sqrt{m_2} ,但 m2 \sqrt{m_2} 有时也被称为"样本二阶中心矩的平方根",在描述统计中作为一个离散度指标。

总结

样本二阶中心矩 m2 m_2 是描述统计和矩估计中最核心的统计量之一。它虽然是有偏的,但在大样本下渐近无偏,且形式简洁、计算方便,在矩法估计、PCA、高阶矩分析等领域有广泛应用。理解它与样本方差 S2 S^2 的区别与联系,是掌握统计推断基础的关键一步。

返回百科索引