
本文介绍如何利用线性回归模型,基于已知的跨量纲数值列(如score1)预测并插补另一列(score2)中的缺失值,关键步骤包括均值填充、标准化、建模与逆变换,确保插补结果符合原始量纲。
本文介绍如何利用线性回归模型,基于已知的跨量纲数值列(如score1)预测并插补另一列(score2)中的缺失值,关键步骤包括均值填充、标准化、建模与逆变换,确保插补结果符合原始量纲。
在实际数据分析中,常遇到多源评分指标(如不同考试、量表或系统产出的分数)具有强相关性但量纲迥异的情况。此时直接使用Min-Max缩放易放大噪声,而简单均值/中位数填充则忽略变量间结构关系。更稳健的做法是构建回归模型,将一列作为特征、另一列作为目标,在统一尺度下学习映射关系,再将预测结果还原至原始量纲。
以下为完整实现流程(以 Score1 → Score2 插补为例):
✅ 正确步骤解析
- 预处理缺失值:对训练前的 NaN 使用列均值临时填充(仅用于标准化),避免 StandardScaler 报错;
- 标准化对齐量纲:对填充后的两列联合标准化(非分别拟合),保证回归在无偏尺度下学习线性关系;
- 构建训练集:仅保留 Score1 和 Score2 均非空的样本作为训练数据;
- 拟合与预测:用 Score1_scaled 预测 Score2_scaled,对 Score2 缺失行执行预测;
- 逆变换还原:将预测得到的标准化 Score2_scaled 值,通过同一 scaler 逆变换回原始量纲。
? 完整可运行代码
import pandas as pd
import numpy as np
from sklearn.preprocessing import StandardScaler
from sklearn.linear_model import LinearRegression
# 构造示例数据
data = {
'Person': ['Alice', 'Bob', 'Charlie', 'Dave', 'John', 'Henry', 'Jane'],
'Score1': [5.6, 9.3, 7.2, -4.0, np.nan, 11.0, 3.0],
'Score2': [3.2, 8.7, np.nan, np.nan, 10.0, 13.0, 8.0]
}
df = pd.DataFrame(data)
# Step 1: 均值填充(仅用于标准化,不参与建模)
df['Score1_filled'] = df['Score1'].fillna(df['Score1'].mean())
df['Score2_filled'] = df['Score2'].fillna(df['Score2'].mean())
# Step 2: 联合标准化(关键!使用同一 scaler 拟合两列)
scaler = StandardScaler()
df[['Score1_scaled', 'Score2_scaled']] = scaler.fit_transform(
df[['Score1_filled', 'Score2_filled']]
)
# Step 3: 提取完整观测样本用于训练
train_mask = df['Score1'].notna() & df['Score2'].notna()
train_data = df[train_mask].copy()
# Step 4: 训练线性回归模型
model = LinearRegression()
model.fit(train_data[['Score1_scaled']], train_data['Score2_scaled'])
# Step 5: 对 Score2 缺失行预测
missing_mask = df['Score2'].isna()
score1_scaled_missing = df.loc[missing_mask, 'Score1_scaled'].values.reshape(-1, 1)
predicted_score2_scaled = model.predict(score1_scaled_missing)
# Step 6: 写入预测值并逆变换还原
df.loc[missing_mask, 'Score2_scaled'] = predicted_score2_scaled
# 注意:仅对 Score2 列逆变换需构造临时数组(因 scaler.inverse_transform 要求二维输入)
temp_scaled = np.column_stack([
df['Score1_scaled'],
df['Score2_scaled']
])
df[['Score1', 'Score2']] = scaler.inverse_transform(temp_scaled)[:, [0, 1]]
print(df[['Person', 'Score1', 'Score2']].round(6))
⚠️ 关键注意事项
- 禁止分别标准化:若对 Score1 和 Score2 单独调用 fit_transform,会破坏两列间的相对关系,导致回归失效;
- 训练集必须完整:模型只能在 Score1 和 Score2 同时非空的样本上训练,否则引入偏差;
- 逆变换需谨慎:scaler.inverse_transform() 输入必须与 fit_transform() 形状一致;此处通过拼接两列再选取对应列还原,确保一致性;
- 模型可扩展:如关系非线性,可替换为 RandomForestRegressor 或添加多项式特征;
- 评估建议:在完整样本上交叉验证 R² 或 RMSE,验证插补可靠性。
该方法兼顾统计合理性与工程实用性,既尊重原始量纲差异,又充分利用变量间潜在关联,是跨尺度缺失值插补的推荐实践。











