面板数据 (Panel Data)
面板数据(纵贯数据)是计量经济学中同时包含横截面数据和时间序列数据维度的数据结构。表示为对个体 i=1,…,N 在时间 t=1,…,T 的观测 {Xit}。分为平衡面板(每个体完整观测)和非平衡面板(不同个体观测长度不同)。
面板数据的优势
- 控制不可观测的个体异质性(最核心优势):控制不随时间变化的个体特征(能力、管理文化、制度),消除遗漏变量偏误
- 更丰富的信息:结合个体间和个体内变异,增大样本量(N×T),提高自由度,减少多重共线性
- 研究动态调整过程:追踪同一体的时间变化,分析状态依赖
基础面板数据模型
模型:yit=β0+xit′β+uit
混合回归模型:忽略面板结构直接OLS,要求误差项与解释变量在所有维度不相关且无个体未观测因素——现实极少成立。
固定效应模型 (FE):yit=xit′β+αi+ϵit,αi 为个体固定效应(允许与 xit 相关)。通过组内离差变换(减个体均值)消除 αi:(yit−yˉi)=(xit−xˉi)′β+(ϵit−ϵˉi)。优点:即使 αi 与 xit 相关也可一致估计;缺点:无法估计不随时间变化的变量系数。
随机效应模型 (RE):假设个体效应 αi 与解释变量不相关(Cov(xit,αi)=0)。因同一体不同时期含共同 αi 导致序列相关,需用广义最小二乘法(GLS)。优点:若假设成立比FE更有效,可估计不随时间变化系数;缺点:假设很强,被违背则有偏且不一致。
模型选择——豪斯曼检验 (Hausman Test):H0为RE成立(Cov(xit,αi)=0)。拒绝H0则应选FE,未拒绝可选RE(更有效)。
扩展
双向固定效应(同时控制个体和时间效应)、动态面板数据模型(含滞后因变量,需广义矩方法GMM/Arellano-Bond估计量处理内生性)、长面板(需考虑平稳性和协整)。