特征选择 (feature selection)
特征选择 (Feature Selection)
特征选择 (Feature Selection) 是统计学习和计量经济学中从候选变量集合中识别对预测或解释目标变量最具贡献的子集的过程。在高维数据场景中——变量数 接近甚至远超样本量 ——特征选择不仅是降低模型复杂性、提高预测精度的手段,更是使估计问题从不可解变为可解的必要条件。特征选择的理论基础横跨信息论、正则化理论和假设检验,实践中通过过滤法、包裹法和嵌入法三条路径实现。
三大方法论路线
过滤法 (Filter Methods) 在模型训练之前根据变量与目标之间的统计相关性独立筛选特征。皮尔逊相关系数、互信息、卡方检验和ANOVA F统计量是典型的单变量相关性度量。过滤法的优势在于计算效率极高(线性于 ),适用于超高维的初始粗筛,但忽视了变量之间的交互效应和多元共线性。
包裹法 (Wrapper Methods) 将模型性能作为特征子集的评价准则,通过搜索算法(前向选择、后向剔除、递归特征消除)遍历子集空间。每一步子集评价需重新训练模型,计算成本随 指数增长。包裹法能捕捉变量间的交互,但容易过拟合——被选中的子集可能在训练数据上表现优异而在独立样本上退化。
嵌入法 (Embedded Methods) 将特征选择内嵌于模型训练过程中,使模型参数估计本身产生稀疏解。Lasso回归 (L1正则化) 是最具代表性的嵌入法:通过对回归系数施加 惩罚 ,在 充分大时将部分系数精确压缩至零,等价于硬阈值特征选择。弹性网 (Elastic Net) 结合 和 惩罚,在变量高度相关时优于纯 Lasso。基于树的集成方法(随机森林、XGBoost)通过特征重要度排序提供另一种嵌入途径。
经济建模中的考量
在实证经济学中,特征选择面临不同于纯预测问题的特殊张力。预测导向的选择(如 Lasso)可能排除理论上关键但统计微弱的结构变量,造成遗漏变量偏差,使模型的因果解释失效。双重选择 (double selection) 和后双选择 (post-double-selection) 方法——对处理变量方程和结果方程均做 Lasso 选择后取变量并集再回归——在高维混杂控制中恢复了处理效应的有效推断。这一方法论在劳动经济学和发展经济学的政策评估中提供了正则化方法与因果推断兼容的路径,代表了特征选择从纯预测到结构估计的重要延伸。