异常值 (outliers)
异常值 (Outliers)
异常值(Outliers)是指在数据集中与其他观测值显著偏离的数据点。从统计学的角度看,异常值并非简单的"错误数据"——它可能来源于测量误差、数据录入错误、抽样偏差,也可能恰恰揭示了数据生成过程中真实存在的肥尾分布特征或结构突变。因此,异常值的识别与处理是探索性数据分析和稳健统计推断的核心议题。
异常值的形式定义
异常值的界定依赖于分布假设和偏离度量。设样本观测值为 ,最常见的定义框架如下。
基于标准差的定义:在正态分布假设下,若某个观测值与样本均值 的距离超过 倍标准差 ,即 ,则视其为异常值。通常取 (对应正态分布下约 0.27\% 的尾概率)。然而,该定义本身受到异常值的污染——均值和标准差对异常值敏感,这构成了经典的掩蔽效应问题:异常值的存在可能扭曲均值和标准差的估计,使真正的异常值反而看起来"正常"。
基于分位数的定义(Tukey 箱线图准则):设第一四分位数为 ,第三四分位数为 ,四分位距 。观测值若满足:
则被标记为异常值。这一准则不依赖分布假设,且四分位数和 IQR 是稳健统计量,受异常值影响较小。将系数从 1.5 放宽至 3 时,标识的是"极端异常值"。
基于统计模型的判别:在回归框架中,学生化残差(Studentized Residual)是常用的诊断工具。对于线性模型 ,第 个观测的学生化残差为:
其中 为普通残差, 为剔除第 个观测后的残差标准差估计, 为帽子矩阵的第 个对角元(杠杆值)。 或 通常提示该观测可能为异常值。
异常值、杠杆点与影响点
在回归分析中,区分三个相关但不同的概念至关重要:
- 异常值 (Outlier):在 方向上远离回归趋势的观测点,即残差绝对值很大。
- 高杠杆点 (High Leverage Point):在 空间中远离其他观测的点,通过帽子矩阵的对角元 衡量——当 ( 为参数个数)时通常被视为高杠杆点。
- 影响点 (Influential Point):对回归结果(系数估计、标准误、拟合值)产生实质性影响的点。常用诊断指标是Cook距离 (Cook's Distance): \[ D_i = \frac{e_i^2}{p \cdot MSE} \cdot \frac{h_{ii}}{(1 - h_{ii})^2} \] 或 提示该观测具有较大影响。
一个高杠杆点可能完全不是异常值(恰好在回归线延伸方向上),一个异常值也可能并非影响点(杠杆低时其对回归系数的影响有限)。只有同时具有较大残差和较高杠杆的点,才会成为真正的影响点。
稳健估计与处理策略
对异常值的处理方法取决于其成因和分析目标,核心原则是:绝不自动化地删除数据。
数据核查优先:首先排除可识别的错误——如数据录入错误(小数点错位、单位混淆)或仪器故障导致的极端读数。这类异常值经核实后应予以修正或剔除。
稳健回归方法:当异常值反映的是重尾分布的真实特征时,直接删除会损失信息,更可取的做法是采用对异常值不敏感的稳健估计方法。M-估计量(M-estimator)通过降低大残差观测的权重来减轻异常值影响,其目标函数为:
其中 是一个增长慢于二次函数的损失函数。常见选择包括 Huber 损失函数(残差较小时为二次、较大时为线性)和 Tukey 双权重函数(极端残差权重趋近于零)。
Winsorizing 与截尾:Winsorizing 将超过指定分位数(如第 1 和第 99 百分位数)的观测值替换为对应分位数值,而非删除;截尾(Trimming)则直接剔除极端观测。两者在稳健统计中广泛使用,但截尾会损失样本量。
变换方法:通过对数变换 、Box-Cox变换等将偏态分布拉近正态,可减少数据中极端值的相对偏离程度。这对于处理正偏态的经济变量(如收入、公司规模)尤其有效。
异常值与经济数据
经济与金融数据中异常值的普遍性源于其内在的分布特征。资产收益率呈现尖峰厚尾(Leptokurtic),极端事件的发生频率远超正态分布预测——这正是黑天鹅事件概念的数据基础。在宏观经济学中,GDP 增长率、通货膨胀等指标常因战争、自然灾害、政策剧变等外生冲击而出现异常值。在微观计量经济学中,企业层面的数据(利润、研发支出等)通常高度右偏,大企业的极端值可能对回归结果产生不成比例的影响。
异常值的处理并非纯粹的技术问题——它要求研究者在统计规则和领域知识之间做出权衡。一个"异常"的数据点可能恰恰是识别结构断点、政策干预效应或市场异象的关键线索。正如Tukey所强调的:在确认数据"错误"之前,应先倾听数据试图告诉我们的故事。