为什么Scikit-learn 1.0版本后推荐使用get_feature_names_out方法?

老辰同学_9167

老辰同学_9167

2026-08-26

171人浏览

原创

get_feature_names_out 是 scikit-learn 1.0 起强制替代 get_feature_names 的标准接口,必须在 fit 或 fit_transform 后调用,返回 ndarray of str,行为因 estimator 类型而异,且无 set_output 自动返回 dataframe 功能。

为什么scikit-learn 1.0版本后推荐使用get_feature_names_out方法?

get_feature_names_out 是标准接口,不是“推荐用”,而是“必须用”

从 scikit-learn 1.0 开始,get_feature_names 被正式标记为 deprecated;到 1.2 版本,它已被完全移除。如果你还在代码里写 vectorizer.get_feature_names(),运行时会触发 FutureWarning,升级后直接抛 AttributeError。这不是风格偏好,是 API 断层——旧方法已不存在。

调用 get_feature_names_out 前必须先 fit 或 fit_transform

这个方法不接受未拟合对象的调用,否则报 NotFittedError。常见错误是:先初始化 CountVectorizer,再直接调 .get_feature_names_out(),中间漏了 .fit().fit_transform()

万能小in
万能小in

万能小in是一款AI论文写作工具,3分钟生成4万字、涵盖150+应用的毕业论文,仅需提供标题。

下载
  • 正确顺序:先 vectorizer.fit(corpus)vectorizer.fit_transform(corpus),再调 .get_feature_names_out()
  • 如果只用 transform()(没 fit 过),也会失败——它不学习词汇表,也就无特征名可返回
  • get_feature_names_out() 返回的是 numpy.ndarray of str,不是 list,别用 .append() 或下标赋值去改它

不同 estimator 的 get_feature_names_out 行为差异很大

它不是万能列名生成器,输出取决于 estimator 类型和参数配置:

  • CountVectorizerTfidfVectorizer:返回实际提取的词项,如 ['and', 'document', 'first']
  • StandardScaler(≥1.2):默认返回 ['x0', 'x1'],除非你传入 feature_names_in_ 并启用 convert_dtype=True
  • OneHotEncoder(≥1.0):若输入是 DataFrame 且设了 drop='first',返回名会带后缀如 ['category_A', 'category_B'],但 sparse=True 时可能打乱顺序
  • ColumnTransformer:必须显式传 input_features=X.columns,否则各分支 fallback 到默认命名

为什么不能靠 set_output 自动返回 DataFrame?

网上流传的 set_output 方法根本不存在——scikit-learn 没提供、没文档、没源码。想让 StandardScaler.transform() 返回 DataFrame?只能手动桥接:

  • 确保输入是 pd.DataFrame,且 .columns 非空
  • 调用 scaler.transform(X) 得到 ndarray
  • scaler.get_feature_names_out() 拿列名,再套 pd.DataFrame(..., columns=..., index=X.index)
  • 注意:sklearn 故意不自动返回 DataFrame,是为了避免 dtype 推断开销和跨库依赖,这点容易被忽略

相关文章

PHP速学视频免费教程(入门到精通)
PHP速学视频免费教程(入门到精通)

PHP怎么学习?PHP怎么入门?PHP在哪学?PHP怎么学才快?不用担心,这里为大家提供了PHP速学教程(入门到精通),有需要的小伙伴保存下载就能学习啦!

下载

本站声明:本文内容由网友自发贡献,版权归原作者所有,本站不承担相应法律责任。如您发现有涉嫌抄袭侵权的内容,请联系admin@php.cn

相关专题

更多
Python 机器学习入门与 Scikit-Learn 实战
Python 机器学习入门与 Scikit-Learn 实战

面向机器学习初学者,以 Scikit-Learn 为核心工具,讲解机器学习基本概念(监督学习/无监督学习/模型评估)、数据预处理(标准化/归一化/缺失值填充/特征编码)、常用分类算法(逻辑回归/决策树/随机森林/SVM/KNN)、回归算法(线性回归/岭回归/Lasso)、无监督聚类(K-Means/DBSCAN)、交叉验证与超参数调优(GridSearch/RandomSearch)、混淆矩阵与 ROC/AUC 模型评估指标,帮助开发者

2026.04.24

295

29

AionClaw AI智能体与电脑自动化任务执行功能使用教程
AionClaw AI智能体与电脑自动化任务执行功能使用教程

AionClaw专题整理AI智能体与电脑自动化相关功能使用教程,涵盖安装部署、AI任务执行、Skills技能、文件处理、浏览器控制、电脑操作、持久记忆、聊天工具连接以及办公、编程和内容创作等功能,帮助用户快速掌握AionClaw的实际使用方法。

2026.09.20

0

15

AI视频生成软件推荐
AI视频生成软件推荐

本专题汇总了当前主流的AI视频生成软件推荐与排行榜单,涵盖seko、AniShort、剧云、Lovart、LiblibAI及立刻mv等热门工具。同时整理了各软件在文生视频、图生视频、时长限制、画质表现及免费额度等方面的差异对比,助您快速选对适合创作需求的AI视频生成工具。

2026.09.16

160

9

ai生成视频的工具免费版合集
ai生成视频的工具免费版合集

本专题汇总了当前免费AI生成视频工具的排行榜与推荐清单,涵盖seko、讯飞智作、AniShort及剧云、Lovart等多模型集成平台。同时整理了各工具的免费额度、输出时长、水印政策及适用场景差异,助您快速选择合适工具开启AI视频创作。

2026.09.16

60

10

Pandas时间序列分析与可视化报表
Pandas时间序列分析与可视化报表

本专题整理Pandas日期转换、时间索引、重采样、滚动窗口、时区处理、plot绘图、Styler表格样式和报表输出方法。

2026.09.16

80

23

Pandas数据筛选索引与清洗处理
Pandas数据筛选索引与清洗处理

本专题整理Pandas中的loc、iloc、条件筛选、query查询、缺失值处理、重复值删除、类型转换和字符串列清洗方法。

2026.09.16

40

25

Pandas数据读取导入与文件导出处理
Pandas数据读取导入与文件导出处理

本专题整理Pandas读取CSV、Excel、JSON、SQL、Parquet等文件的方法,以及to_csv、to_excel、to_sql和to_parquet等常用数据导出流程。

2026.09.16

40

27

GDB怎么设置断点
GDB怎么设置断点

本专题介绍GDB按照函数名、源代码行号和文件位置设置断点的方法,详细说明run、continue、next、step等命令的配合使用,帮助定位程序崩溃、逻辑异常及代码未按预期执行的问题。

2026.09.11

360

28

GDB怎么查看变量值
GDB怎么查看变量值

本专题介绍GDB调试过程中查看变量值的具体方法,涵盖局部变量、函数参数、数组、结构体和指针内容查询,同时整理变量持续显示、格式化输出及无法读取变量时的排查思路。

2026.09.11

120

22

热门下载

更多
网站特效
/
网站源码
/
网站素材
/
前端模板

精品课程

更多
热门推荐
/
最新课程
phpStudy极速入门视频教程
phpStudy极速入门视频教程

共6课时 | 54.6万人学习

独孤九贱(4)_PHP视频教程
独孤九贱(4)_PHP视频教程

共89课时 | 133万人学习