卡方随机变量 (Chi-Square Random Variable)
卡方随机变量,通常记为 χ2,是概率论与统计学中最重要的连续型随机变量之一。它由 自由度 (Degrees of Freedom) 参数 ν(或记为 k)唯一确定,记作 X∼χ2(ν) 或 X∼χk2。卡方分布在统计推断——尤其是假设检验、置信区间构造以及方差分析中占据核心地位。其起源可追溯至十九世纪末卡尔·皮尔逊 (Karl Pearson) 对拟合优度检验的研究。
定义与构造
从构造角度而言,若 Z1,Z2,…,Zν 是 ν 个相互独立且服从标准正态分布 N(0,1) 的随机变量,则卡方随机变量定义为其平方和:
X=i=1∑νZi2∼χ2(ν)
这一构造方式直接揭示了卡方分布与正态分布的源流关系。在线性回归与计量经济学中,普通最小二乘法 (OLS) 残差的平方和经过适当标准化后即服从卡方分布,这构成了对模型方差进行统计推断的理论基础。
推导过程需明确两点:第一,每个 Zi2 均服从自由度为 1 的卡方分布 χ2(1)。可以证明,若 Z∼N(0,1),令 Y=Z2,则 Y 的概率密度函数为:
fY(y)=2πy1e−y/2,y>0
这恰是 χ2(1) 的密度函数。第二,利用伽马分布的性质可知,独立卡方变量的和仍服从卡方分布,其自由度为各分量自由度之和。由此,∑i=1νZi2 服从 χ2(ν)。
概率密度函数
自由度为 ν 的卡方随机变量的概率密度函数 (PDF) 为:
f(x;ν)=2ν/2Γ(ν/2)1xν/2−1e−x/2,x>0
其中 Γ(⋅) 是伽马函数,定义为 Γ(z)=∫0∞tz−1e−tdt。当 ν 为正整数时,Γ(ν/2) 可简化为阶乘形式。密度函数的支撑集严格为正实数 (0,∞),这意味着卡方随机变量只能取正值——这是一个关键性质,因为它作为平方和的非负性约束。
从密度函数的形态看:
- 当 ν=1 或 ν=2 时,密度函数在 x→0+ 处趋于无穷大,呈单调递减形态;
- 当 ν≥3 时,密度函数在 x=ν−2 处取得众数,呈右偏单峰形态;
- 随着自由度 ν 的增大,卡方分布的偏度逐渐减弱,形态趋近于正态分布——这是中心极限定理的直接推论。
数字特征
卡方随机变量的数字特征简洁而优美:
E[X]=ν,Var(X)=2ν
期望等于自由度,方差是自由度的两倍。这一性质来源于构造定义:E[Zi2]=Var(Zi)+[E(Zi)]2=1+0=1,故 E[X]=∑E[Zi2]=ν;而 Var(Zi2)=E[Zi4]−[E(Zi2)]2=3−1=2(标准正态的四阶矩为 3),又因独立性,Var(X)=∑Var(Zi2)=2ν。
进一步,卡方分布的矩母函数 (MGF) 为:
MX(t)=E[etX]=(1−2t)−ν/2,t<21
矩母函数在推导卡方分布的可加性以及证明其与指数分布、伽马分布的关系时极为便利。事实上,χ2(ν) 是伽马分布的特殊情形:若令形状参数 α=ν/2,尺度参数 β=2,则 X∼Gamma(ν/2,2),其与伽马分布族的隶属关系使得许多性质可以共享。
可加性
卡方分布具有可加性(或再生性):若 X1∼χ2(ν1) 与 X2∼χ2(ν2) 相互独立,则其和服从自由度为 ν1+ν2 的卡方分布:
X1+X2∼χ2(ν1+ν2)
可加性在统计推断中具有深远的应用价值。例如,在方差分析 (ANOVA) 中,总平方和被分解为组间平方和与组内平方和之和,每个分量在相应零假设下均服从卡方分布,且相互独立,从而总平方和的分布可由可加性直接导出。类似地,在似然比检验中,嵌套模型的对数似然比统计量渐近服从卡方分布,其自由度等于两模型参数个数之差,这一结论也是可加性在渐近框架下的体现。
与其他分布的关系
卡方分布与多个核心分布存在密切联系,构成了统计推断中的分布族网络:
- 标准正态分布: χ2(1)=Z2,即单个标准正态变量的平方服从卡方分布。
- 指数分布: χ2(2) 等价于参数为 λ=1/2 的指数分布,即其密度函数为 f(x)=21e−x/2,x>0。
- 伽马分布: 如上所述,χ2(ν)≡Gamma(ν/2,2)。
- t分布: 若 Z∼N(0,1) 与 X∼χ2(ν) 独立,则 T=X/νZ∼t(ν)。这一定义是学生t分布在单样本和双样本均值检验中的构造基础。
- F分布: 若 X1∼χ2(ν1) 与 X2∼χ2(ν2) 独立,则 F=X2/ν2X1/ν1∼F(ν1,ν2)。F分布是方差分析、回归模型整体显著性检验(F检验)以及邹检验 (Chow Test) 的核心分布。
这些关系揭示了一个清晰的理论层级:标准正态处于底层,卡方由其平方和构造,t分布和F分布则由正态与卡方的比值构造。理解这一层级对于掌握经典统计推断的逻辑至关重要。
在统计推断中的应用
方差估计与置信区间
设 X1,…,Xn 是从均值为 μ、方差为 σ2 的正态总体中抽取的随机样本。样本方差 s2=n−11∑i=1n(Xi−Xˉ)2 经标准化后服从卡方分布:
σ2(n−1)s2∼χ2(n−1)
这一结果——有时被称为 Cochran 定理的推论——构成了正态总体方差 σ2 的置信区间估计与假设检验的枢轴量。由此可构造 σ2 的 100(1−α)% 置信区间:
(χα/2,n−12(n−1)s2,χ1−α/2,n−12(n−1)s2)
其中 χα,ν2 表示 χ2(ν) 的上侧 α 分位数。
拟合优度检验
皮尔逊卡方检验是分析分类数据最经典的方法。检验统计量:
χ2=i=1∑kEi(Oi−Ei)2
在零假设下近似服从 χ2(k−1−m) 分布,其中 Oi 为观测频数,Ei 为期望频数,m 为从数据中估计的参数个数。该统计量的直觉在于:若零假设为真,观测值与期望值之间的差异应仅反映抽样变异性,标准化后的平方和不应过大。
独立性检验
在列联表分析中,卡方独立性检验用于判断两个分类变量是否关联。对于一个 r×c 的列联表,检验统计量在独立性零假设下近似服从 χ2((r−1)(c−1)) 分布。该检验广泛应用于社会科学、医学和经济学中的调查数据分析。
非中心卡方分布
当构造卡方变量的正态分量均值不全为零时,得到的分布称为非中心卡方分布 (Noncentral Chi-Square Distribution)。具体地,若 Zi∼N(μi,1) 且相互独立,则 ∑Zi2∼χ2(ν,λ),其中非中心参数 λ=∑μi2。非中心卡方分布在计算检验的功效 (Power) 时不可或缺:当备择假设为真实时,许多检验统计量服从非中心卡方分布,其非中心参数刻画了偏离零假设的程度。在样本量计算与功效分析中,非中心卡方分布的分位数与累积分布函数的计算是标准工具。