如何正确选择分类特征与数值特征以构建训练测试数据集

大明姑娘_4832

大明姑娘_4832

2026-07-05

1012人浏览

原创

如何正确选择分类特征与数值特征以构建训练测试数据集

本文详解在pandas中安全分离并合并分类特征与数值特征的正确方法,避免因列索引长度不一致导致的广播错误(valueerror),推荐使用union()或append()替代直接列表拼接。

本文详解在pandas中安全分离并合并分类特征与数值特征的正确方法,避免因列索引长度不一致导致的广播错误(valueerror),推荐使用union()或append()替代直接列表拼接。

在机器学习数据预处理阶段,常需将DataFrame中的特征按数据类型划分为分类特征(categorical)和数值特征(numerical),再统一提取用于建模。但若直接用Python原生加法(+)拼接两个Index对象(如categorical_features + numerical_features),极易触发ValueError: operands could not be broadcast together——这是因为Pandas的Index对象不支持按元素广播式拼接,而+操作在此上下文中可能被误解释为数组级运算,尤其当两类特征列数不同时(如87列 vs 42列),底层尝试对齐失败即报错。

✅ 正确做法是使用Pandas内置的集合操作方法:

推荐首选:union()(去重且有序)
该方法返回两个Index的并集,自动去重、保持字典序,并兼容所有Pandas版本(包括最新版):

categorical_features = df.select_dtypes(include=['object', 'category']).columns
df = df.dropna(subset=categorical_features)  # 先处理缺失值,避免后续编码失败
numerical_features = df.select_dtypes(include=['int64', 'float64']).columns

all_features = categorical_features.union(numerical_features)  # 安全合并
X = df[all_features].copy()
y = df['JobSatisfaction'].copy()

⚠️ 注意事项:

知了zKnown
知了zKnown

知了zKnown是一款面向信息降噪和阅读提效的 AI 个人知识助手。

下载
  • dropna(subset=...) 应在特征筛选后、合并前执行,确保仅对实际参与建模的分类列做缺失值清理;
  • 若后续需独热编码(One-Hot Encoding),建议保留原始分类列名,避免union()后顺序干扰列对应关系;
  • union()结果默认升序排列,如需保持原始声明顺序,可改用Index.append()(见下文)。

备选方案:append()(保留顺序,不自动去重)
适用于需维持特征出现顺序的场景(如按业务逻辑分组),但需自行确保无重复列名:

all_features = categorical_features.append(numerical_features)
# 验证无重复(可选)
assert all_features.is_unique, "Feature names must be unique"
X = df[all_features].copy()

❌ 避免写法:

  • list(categorical_features) + list(numerical_features) → 转为普通列表虽可运行,但丢失Index语义,且无法利用Pandas优化;
  • np.concatenate([categorical_features, numerical_features]) → 易引发类型/对齐问题,非Pandas惯用范式。

最后提醒:特征选择后,务必验证X.shape与y.shape[0]一致,并检查X中是否混入目标变量(如JobSatisfaction本身被误纳入特征),这是常见调试盲点。规范的特征分离流程是稳健建模的第一步。

相关文章

PHP速学视频免费教程(入门到精通)
PHP速学视频免费教程(入门到精通)

PHP怎么学习?PHP怎么入门?PHP在哪学?PHP怎么学才快?不用担心,这里为大家提供了PHP速学教程(入门到精通),有需要的小伙伴保存下载就能学习啦!

下载

相关标签:

本站声明:本文内容由网友自发贡献,版权归原作者所有,本站不承担相应法律责任。如您发现有涉嫌抄袭侵权的内容,请联系admin@php.cn

相关专题

更多
Python 机器学习入门与 Scikit-Learn 实战
Python 机器学习入门与 Scikit-Learn 实战

面向机器学习初学者,以 Scikit-Learn 为核心工具,讲解机器学习基本概念(监督学习/无监督学习/模型评估)、数据预处理(标准化/归一化/缺失值填充/特征编码)、常用分类算法(逻辑回归/决策树/随机森林/SVM/KNN)、回归算法(线性回归/岭回归/Lasso)、无监督聚类(K-Means/DBSCAN)、交叉验证与超参数调优(GridSearch/RandomSearch)、混淆矩阵与 ROC/AUC 模型评估指标,帮助开发者

2026.04.24

335

29

Buffalo框架数据库开发全教程
Buffalo框架数据库开发全教程

本专题围绕Buffalo框架数据库开发,讲解database.yml多环境配置、soda与fizz迁移生成回滚、模型结构体标签、增删改查与条件查询、一对多与多对多关联、数据校验、回调钩子、事务处理及原生SQL执行能力。

2026.09.23

160

15

Buffalo框架路由与请求处理实操指南
Buffalo框架路由与请求处理实操指南

本专题讲解Buffalo框架路由与请求处理机制,涵盖路由注册与分组、资源路由、Handler编写规范、Context上下文方法、参数绑定、中间件编写挂载、Session与Cookie读写、Flash消息及错误页面定制方法。

2026.09.23

80

15

Buffalo框架零基础入门教程
Buffalo框架零基础入门教程

本专题整理Buffalo框架入门内容,涵盖Go环境准备、buffalo CLI安装、新项目生成、目录结构说明、dev热加载启动、数据库连接配置与常见报错排查,帮助新手按约定优于配置的思路跑通第一个Buffalo框架应用。

2026.09.23

80

15

Conan创建软件包配方指南
Conan创建软件包配方指南

本专题介绍通过conanfile.py创建软件包的方法,讲解包名、版本、依赖和构建设置等基础信息,以及source、build、package、package_info等常用方法的作用及编写思路。

2026.09.22

40

12

Conan二进制包配置指南
Conan二进制包配置指南

本专题介绍Conan根据操作系统、编译器、架构和构建类型生成二进制包的方法,讲解Profile、Settings、Options及Package ID的作用,帮助管理不同平台和编译环境下的包版本。

2026.09.22

60

13

Conan私有仓库搭建教程
Conan私有仓库搭建教程

本专题系统的讲解Conan私有仓库的搭建流程,涵盖仓库服务部署、存储目录配置、用户认证、权限划分和远程地址添加,并介绍内部C++依赖包的上传、下载及版本维护方法。

2026.09.22

60

19

loomy官网入口地址合集
loomy官网入口地址合集

本专题汇总了 Loomy 桌面 AI 助理的官方入口地址合集及使用指南。提供 macOS 与 Windows 客户端下载 。Loomy 是讯飞推出的桌面级 AI 工作搭子,支持文件整理、数据分析、网页操作及通过飞书/钉钉远程操控电脑,助你高效完成本地办公任务 。

2026.09.22

60

19

NumPy常见函数使用方法
NumPy常见函数使用方法

本专题整理 NumPy 常见函数使用方法相关教程,覆盖函数大全、参数用法、数组运算、统计聚合、排序处理、where 条件筛选、linspace 创建数列等常用场景,帮助读者快速掌握 NumPy 函数调用思路和实际数据处理技巧。

2026.09.22

80

21

热门下载

更多
网站特效
/
网站源码
/
网站素材
/
前端模板

精品课程

更多
热门推荐
/
最新课程
phpStudy极速入门视频教程
phpStudy极速入门视频教程

共6课时 | 54.6万人学习

独孤九贱(4)_PHP视频教程
独孤九贱(4)_PHP视频教程

共89课时 | 133.3万人学习