Python中如何使用PolynomialFeatures生成非线性特征?

小静大大_4050

小静大大_4050

2026-07-15

736人浏览

原创

polynomialfeatures 生成指定阶数的多项式特征组合,如 x=[[a,b]]、degree=2 时输出 [1,a,b,a²,ab,b²];需注意输入维度、缺失值处理、高维爆炸及 pipeline 中标准化顺序等实操要点。

python中如何使用polynomialfeatures生成非线性特征?

PolynomialFeatures 生成的特征到底长啥样?

它不直接返回拟合结果,而是把原始特征按指定阶数做笛卡尔积组合,再拼成新特征矩阵。比如 X = [[a, b]],degree=2 时输出是 [1, a, b, a², ab, b²](默认含截距项)。注意:顺序固定,但不同版本可能因 include_bias 或 interaction_only 改变列数。

实操建议:

  • 用 fit_transform(X) 一次性完成拟合与转换;单独调 transform(X) 前必须先 fit(),否则报 NotFittedError
  • 原始数据若有缺失值,PolynomialFeatures 不会报错但结果不可靠——务必在它之前用 SimpleImputer 处理
  • 对高维输入(比如 >10 列),degree=3 可能爆炸式增长列数,用 interaction_only=True 能跳过平方项,只保留交叉项

为什么 fit_transform 后的 shape 和预期不符?

常见原因是没注意原始 X 的维度。如果传入的是 1D 数组(如 np.array([1, 2, 3])),PolynomialFeatures 会把它当单个样本、单个特征处理,输出形状是 (1, n_features_out),而非你想要的 (n_samples, n_features_out)。

实操建议:

  • 始终确保输入是二维:用 X.reshape(-1, 1) 处理单特征,或 np.column_stack([x1, x2]) 拼多特征
  • 检查 poly.get_feature_names_out() 输出的列名,比看 shape 更直观——它会告诉你第 3 列到底是 x0^2 还是 x0 x1
  • 若用 pandas DataFrame 输入,PolynomialFeatures 会丢掉列名,后续建议用 pd.DataFrame(transformed, columns=poly.get_feature_names_out()) 恢复可读性

和 Pipeline 配合时容易漏掉什么?

单独用 PolynomialFeatures 没问题,但嵌入 Pipeline 时,常有人忘记标准化步骤的位置。多项式扩展会放大原始特征的量纲差异,若在 PolynomialFeatures 之后才做 StandardScaler,高次项(如 x²)的方差可能比一次项大几个数量级,导致模型权重失衡。

python-code-analyz
python-code-analyz

专业Python代码分析与优化,支持语法检查、安全扫描、性能评估、复杂度分析及重构后优化代码生成。

下载

实操建议:

  • 标准流程应为:StandardScaler → PolynomialFeatures → 模型。别颠倒顺序
  • 在 Pipeline 中,不能直接用 PolynomialFeatures(degree=2, include_bias=False) 然后接线性模型——因为线性模型自己带截距,include_bias=False 可避免冗余常数列
  • 调试时用 pipeline.named_steps['poly'].get_feature_names_out() 查看实际输入模型的特征名,比猜更可靠

degree=2 但模型效果反而下降?

不是所有数据都适合多项式扩展。当原始特征本身已高度非线性(如带周期性、突变点),或噪声较大时,强行加二次项只是拟合噪声,验证集误差上升是典型信号。

实操建议:

  • 先画出原始特征与目标变量的散点图,观察是否存在明显曲率;没有的话,degree=2 很可能徒增复杂度
  • 用 cross_val_score 对比 degree=1 和 degree=2 的 CV 分数,而不是只看训练集 R²
  • 若发现过拟合,优先尝试 interaction_only=True 或降 degree,而不是加正则项——因为多项式特征本身已让设计矩阵条件数变差,L2 正则缓解有限

真正麻烦的是特征交互逻辑本身不合理,比如把「用户年龄」和「订单金额」做交叉项,业务上未必有解释性,模型却记住了这种偶然相关。这时候生成的不是非线性特征,是噪声放大器。

Python免费学习笔记(深入):立即使用
在学习笔记中,你将探索 Python 的核心概念和高级技巧!

相关专题

更多
python打包成可执行文件
python打包成可执行文件

本专题为大家带来python打包成可执行文件相关的文章,大家可以免费的下载体验。

2023.07.20

1671

4

python能做什么
python能做什么

python能做的有:可用于开发基于控制台的应用程序、多媒体部分开发、用于开发基于Web的应用程序、使用python处理数据、系统编程等等。本专题为大家提供python相关的各种文章、以及下载和课程。

2023.07.25

4164

7

format在python中的用法
format在python中的用法

Python中的format是一种字符串格式化方法,用于将变量或值插入到字符串中的占位符位置。通过format方法,我们可以动态地构建字符串,使其包含不同值。php中文网给大家带来了相关的教程以及文章,欢迎大家前来阅读学习。

2023.07.31

1669

3

python教程
python教程

Python已成为一门网红语言,即使是在非编程开发者当中,也掀起了一股学习的热潮。本专题为大家带来python教程的相关文章,大家可以免费体验学习。

2023.08.03

24117

23

python环境变量的配置
python环境变量的配置

Python是一种流行的编程语言,被广泛用于软件开发、数据分析和科学计算等领域。在安装Python之后,我们需要配置环境变量,以便在任何位置都能够访问Python的可执行文件。php中文网给大家带来了相关的教程以及文章,欢迎大家前来学习阅读。

2023.08.04

2947

5

python eval
python eval

eval函数是Python中一个非常强大的函数,它可以将字符串作为Python代码进行执行,实现动态编程的效果。然而,由于其潜在的安全风险和性能问题,需要谨慎使用。php中文网给大家带来了相关的教程以及文章,欢迎大家前来学习阅读。

2023.08.04

2987

5

scratch和python区别
scratch和python区别

scratch和python的区别:1、scratch是一种专为初学者设计的图形化编程语言,python是一种文本编程语言;2、scratch使用的是基于积木的编程语法,python采用更加传统的文本编程语法等等。本专题为大家提供scratch和python相关的文章、下载、课程内容,供大家免费下载体验。

2023.08.11

1163

5

python合并两个列表
python合并两个列表

Python是一种强大的编程语言,具有许多方便的功能和工具。在Python中,有多种方法可以合并两个列表。php中文网给大家带来了相关的教程以及文章,欢迎大家前来学习阅读。

2023.08.10

596

4

python是前端还是后端
python是前端还是后端

Python属于前端也属于后端,其灵活性和丰富的生态系统使得开发人员能够在不同的领域中灵活运用。本专题为大家提供python相关的文章、下载、课程内容,供大家免费下载体验。

2023.08.11

2303

5

热门下载

更多
网站特效
/
网站源码
/
网站素材
/
前端模板

精品课程

更多
相关推荐
/
热门推荐
/
最新课程