使用回归模型跨量纲列进行缺失值插补(Score1→Score2)

轻宇大大_5945

轻宇大大_5945

2026-07-22

646人浏览

原创

使用回归模型跨量纲列进行缺失值插补(Score1→Score2)

本文介绍如何利用线性回归模型,基于已知的跨量纲数值列(如score1)预测并插补另一列(score2)中的缺失值,关键步骤包括均值填充、标准化、建模与逆变换,确保插补结果符合原始量纲。

本文介绍如何利用线性回归模型,基于已知的跨量纲数值列(如score1)预测并插补另一列(score2)中的缺失值,关键步骤包括均值填充、标准化、建模与逆变换,确保插补结果符合原始量纲。

在实际数据分析中,常遇到多源评分指标(如不同考试、量表或系统产出的分数)具有强相关性但量纲迥异的情况。此时直接使用Min-Max缩放易放大噪声,而简单均值/中位数填充则忽略变量间结构关系。更稳健的做法是构建回归模型,将一列作为特征、另一列作为目标,在统一尺度下学习映射关系,再将预测结果还原至原始量纲。

以下为完整实现流程(以 Score1 → Score2 插补为例):

堆友Agent
堆友Agent

堆友Agent是一款AI图像与设计工具,集成大厂专家设计 Skill 的AI设计智能体。

下载

✅ 正确步骤解析

  1. 预处理缺失值:对训练前的 NaN 使用列均值临时填充(仅用于标准化),避免 StandardScaler 报错;
  2. 标准化对齐量纲:对填充后的两列联合标准化(非分别拟合),保证回归在无偏尺度下学习线性关系;
  3. 构建训练集:仅保留 Score1 和 Score2 均非空的样本作为训练数据;
  4. 拟合与预测:用 Score1_scaled 预测 Score2_scaled,对 Score2 缺失行执行预测;
  5. 逆变换还原:将预测得到的标准化 Score2_scaled 值,通过同一 scaler 逆变换回原始量纲。

? 完整可运行代码

import pandas as pd
import numpy as np
from sklearn.preprocessing import StandardScaler
from sklearn.linear_model import LinearRegression

# 构造示例数据
data = {
    'Person': ['Alice', 'Bob', 'Charlie', 'Dave', 'John', 'Henry', 'Jane'],
    'Score1': [5.6, 9.3, 7.2, -4.0, np.nan, 11.0, 3.0],
    'Score2': [3.2, 8.7, np.nan, np.nan, 10.0, 13.0, 8.0]
}
df = pd.DataFrame(data)

# Step 1: 均值填充(仅用于标准化,不参与建模)
df['Score1_filled'] = df['Score1'].fillna(df['Score1'].mean())
df['Score2_filled'] = df['Score2'].fillna(df['Score2'].mean())

# Step 2: 联合标准化(关键!使用同一 scaler 拟合两列)
scaler = StandardScaler()
df[['Score1_scaled', 'Score2_scaled']] = scaler.fit_transform(
    df[['Score1_filled', 'Score2_filled']]
)

# Step 3: 提取完整观测样本用于训练
train_mask = df['Score1'].notna() & df['Score2'].notna()
train_data = df[train_mask].copy()

# Step 4: 训练线性回归模型
model = LinearRegression()
model.fit(train_data[['Score1_scaled']], train_data['Score2_scaled'])

# Step 5: 对 Score2 缺失行预测
missing_mask = df['Score2'].isna()
score1_scaled_missing = df.loc[missing_mask, 'Score1_scaled'].values.reshape(-1, 1)
predicted_score2_scaled = model.predict(score1_scaled_missing)

# Step 6: 写入预测值并逆变换还原
df.loc[missing_mask, 'Score2_scaled'] = predicted_score2_scaled
# 注意:仅对 Score2 列逆变换需构造临时数组(因 scaler.inverse_transform 要求二维输入)
temp_scaled = np.column_stack([
    df['Score1_scaled'], 
    df['Score2_scaled']
])
df[['Score1', 'Score2']] = scaler.inverse_transform(temp_scaled)[:, [0, 1]]

print(df[['Person', 'Score1', 'Score2']].round(6))

⚠️ 关键注意事项

  • 禁止分别标准化:若对 Score1 和 Score2 单独调用 fit_transform,会破坏两列间的相对关系,导致回归失效;
  • 训练集必须完整:模型只能在 Score1 和 Score2 同时非空的样本上训练,否则引入偏差;
  • 逆变换需谨慎:scaler.inverse_transform() 输入必须与 fit_transform() 形状一致;此处通过拼接两列再选取对应列还原,确保一致性;
  • 模型可扩展:如关系非线性,可替换为 RandomForestRegressor 或添加多项式特征;
  • 评估建议:在完整样本上交叉验证 R² 或 RMSE,验证插补可靠性。

该方法兼顾统计合理性与工程实用性,既尊重原始量纲差异,又充分利用变量间潜在关联,是跨尺度缺失值插补的推荐实践。

相关专题

更多
Python 机器学习入门与 Scikit-Learn 实战
Python 机器学习入门与 Scikit-Learn 实战

面向机器学习初学者,以 Scikit-Learn 为核心工具,讲解机器学习基本概念(监督学习/无监督学习/模型评估)、数据预处理(标准化/归一化/缺失值填充/特征编码)、常用分类算法(逻辑回归/决策树/随机森林/SVM/KNN)、回归算法(线性回归/岭回归/Lasso)、无监督聚类(K-Means/DBSCAN)、交叉验证与超参数调优(GridSearch/RandomSearch)、混淆矩阵与 ROC/AUC 模型评估指标,帮助开发者

2026.04.24

335

29

Buffalo框架数据库开发全教程
Buffalo框架数据库开发全教程

本专题围绕Buffalo框架数据库开发,讲解database.yml多环境配置、soda与fizz迁移生成回滚、模型结构体标签、增删改查与条件查询、一对多与多对多关联、数据校验、回调钩子、事务处理及原生SQL执行能力。

2026.09.23

160

15

Buffalo框架路由与请求处理实操指南
Buffalo框架路由与请求处理实操指南

本专题讲解Buffalo框架路由与请求处理机制,涵盖路由注册与分组、资源路由、Handler编写规范、Context上下文方法、参数绑定、中间件编写挂载、Session与Cookie读写、Flash消息及错误页面定制方法。

2026.09.23

80

15

Buffalo框架零基础入门教程
Buffalo框架零基础入门教程

本专题整理Buffalo框架入门内容,涵盖Go环境准备、buffalo CLI安装、新项目生成、目录结构说明、dev热加载启动、数据库连接配置与常见报错排查,帮助新手按约定优于配置的思路跑通第一个Buffalo框架应用。

2026.09.23

80

15

Conan创建软件包配方指南
Conan创建软件包配方指南

本专题介绍通过conanfile.py创建软件包的方法,讲解包名、版本、依赖和构建设置等基础信息,以及source、build、package、package_info等常用方法的作用及编写思路。

2026.09.22

40

12

Conan二进制包配置指南
Conan二进制包配置指南

本专题介绍Conan根据操作系统、编译器、架构和构建类型生成二进制包的方法,讲解Profile、Settings、Options及Package ID的作用,帮助管理不同平台和编译环境下的包版本。

2026.09.22

60

13

Conan私有仓库搭建教程
Conan私有仓库搭建教程

本专题系统的讲解Conan私有仓库的搭建流程,涵盖仓库服务部署、存储目录配置、用户认证、权限划分和远程地址添加,并介绍内部C++依赖包的上传、下载及版本维护方法。

2026.09.22

60

19

loomy官网入口地址合集
loomy官网入口地址合集

本专题汇总了 Loomy 桌面 AI 助理的官方入口地址合集及使用指南。提供 macOS 与 Windows 客户端下载 。Loomy 是讯飞推出的桌面级 AI 工作搭子,支持文件整理、数据分析、网页操作及通过飞书/钉钉远程操控电脑,助你高效完成本地办公任务 。

2026.09.22

60

19

NumPy常见函数使用方法
NumPy常见函数使用方法

本专题整理 NumPy 常见函数使用方法相关教程,覆盖函数大全、参数用法、数组运算、统计聚合、排序处理、where 条件筛选、linspace 创建数列等常用场景,帮助读者快速掌握 NumPy 函数调用思路和实际数据处理技巧。

2026.09.22

80

21

热门下载

更多
网站特效
/
网站源码
/
网站素材
/
前端模板

精品课程

更多
热门推荐
/
最新课程
phpStudy极速入门视频教程
phpStudy极速入门视频教程

共6课时 | 54.6万人学习

独孤九贱(4)_PHP视频教程
独孤九贱(4)_PHP视频教程

共89课时 | 133.3万人学习