
本文详解 statsmodels ols 与 linearmodels panelols 在面板数据固定效应回归中的关键差异,指出仅启用 entity_effects 会导致结果不一致,必须同时指定 time_effects 才能复现相同系数;并解释 r² 差异的统计学本质。
本文详解 statsmodels ols 与 linearmodels panelols 在面板数据固定效应回归中的关键差异,指出仅启用 entity_effects 会导致结果不一致,必须同时指定 time_effects 才能复现相同系数;并解释 r² 差异的统计学本质。
在使用面板数据进行固定效应建模时,开发者常误以为 statsmodels.OLS(配合手动添加虚拟变量)与 linearmodels.PanelOLS 的默认设置天然等价。但如示例所示,当仅对 PanelOLS 设置 entity_effects=True 时,其估计结果(β₁=0.1101, β₂=0.3100)明显偏离 OLS 中显式加入公司和年份虚拟变量的结果(β₁=0.1167, β₂=0.3514),R² 差异更达 0.953 vs 0.767。根本原因在于:二者所拟合的模型设定并不一致。
statsmodels 中的公式 'invest ~ value + capital + C(firm) + C(year) -1' 实际拟合的是双向固定效应模型(Two-Way Fixed Effects)——即同时控制个体(firm)和时间(year)维度的截距项。而 PanelOLS 默认仅启用 entity_effects=True 时,仅控制个体固定效应,未包含时间固定效应,因此模型设定更弱,导致系数偏误和拟合优度下降。
✅ 正确做法是显式启用双向固定效应:
from linearmodels import PanelOLS
data = data.set_index(['firm', 'year'])
panel_fit = PanelOLS(
dependent=data.invest,
exog=data[['value', 'capital']],
entity_effects=True, # 控制 firm 固定效应
time_effects=True # ✅ 关键:控制 year 固定效应
).fit()
执行后,PanelOLS 输出的系数将与 statsmodels.OLS 完全一致(value: 0.1167, capital: 0.3514),验证了二者在相同模型设定下的数值等价性。
⚠️ 需注意:尽管系数一致,R² 仍存在差异(如示例中 0.953 vs 0.7253)。这不是计算错误,而是定义逻辑不同:
- statsmodels.OLS 的 R² 基于含所有虚拟变量的完整设计矩阵(含 N_firm + N_year − 2 个哑变量),总离差由原始因变量 invest 计算;
- PanelOLS 的 R² 则基于去心后的残差(即先对 invest, value, capital 分别做双重中心化:减去组均值再减去时间均值),其总平方和(TSS)已剔除固定效应部分,反映的是“纯解释变量波动”对“去心后因变量波动”的解释比例。
因此,比较 R² 跨模型无意义;应以系数估计值、标准误、显著性及经济解释为准。实践中推荐优先使用 PanelOLS,因其采用高效的组内变换(within transformation)算法,自动处理高维固定效应,避免虚拟变量爆炸,且支持聚类标准误、异方差稳健推断等进阶功能。
总结:确保模型设定对等是结果可比的前提——PanelOLS 必须同时启用 entity_effects=True 和 time_effects=True 才能严格复现含 C(firm) + C(year) 的 OLS 回归;而 R² 差异源于指标定义本质不同,不应作为模型优劣判断依据。











