featureunion自scikit-learn 1.2起被弃用、1.4版彻底移除,标准替代方案是columntransformer;它支持列名选择、自动拼接稀疏/稠密矩阵、保留可解释性,且避免类型不匹配、内存爆炸和列名丢失等问题。

FeatureUnion在scikit-learn中已被弃用,改用ColumnTransformer更安全
直接说结论:FeatureUnion 从 scikit-learn 1.2 开始已标记为 Deprecated,1.4 版本彻底移除。现在合并多个特征提取器的**标准做法是用 ColumnTransformer**,它更清晰、更健壮,且天然支持列名和稀疏矩阵处理。
如果你看到老教程或代码里还在用 FeatureUnion + Pipeline 拼接 TfidfVectorizer 和 StandardScaler,那大概率跑不通或报 FutureWarning。别硬扛,直接重构。
ColumnTransformer怎么替代FeatureUnion做文本+数值特征拼接
典型场景:一个 DataFrame 同时含文本列(如 "review")和数值列(如 "rating", "length"),需要分别做 TF-IDF 和标准化,再横向合并成一个特征矩阵。
-
ColumnTransformer的transformers参数接收三元组:("name",transformer,column_selector) - 列选择器可以是字符串(单列)、字符串列表(多列)、整数索引、布尔数组,或自定义函数(返回布尔 Series)
- 默认
remainder="drop",想保留未指定列就设remainder="passthrough" - 输出是
scipy.sparse矩阵(TF-IDF)和numpy.ndarray(StandardScaler)的自动拼接,无需手动np.hstack
from sklearn.compose import ColumnTransformer
from sklearn.feature_extraction.text import TfidfVectorizer
from sklearn.preprocessing import StandardScaler
<p>preprocessor = ColumnTransformer(
transformers=[
("tfidf", TfidfVectorizer(max_features=1000), "review"),
("num", StandardScaler(), ["rating", "length"]),
],
remainder="drop"
)</p><p>X_processed = preprocessor.fit_transform(df)</p><h1>X_processed 是 shape (n_samples, 1002) 的 sparse matrix</h1><p></p>
为什么不用Pipeline套FeatureUnion?容易踩哪些坑
旧写法常见错误包括:
-
FeatureUnion输入必须是二维数组,但TfidfVectorizer对单列 Series 默认输出稀疏矩阵,而StandardScaler要求二维 ndarray —— 类型不一致导致ValueError: Expected 2D array, got 1D array instead - 手动拼接需调用
scipy.sparse.hstack或np.column_stack,但二者对稀疏/稠密混合输入行为不一致,容易静默转稠密,内存爆炸 - 列名丢失:
FeatureUnion不保留原始列信息,后续 debug 或模型解释困难 - 无法指定不同列用不同预处理器,只能靠
FunctionTransformer做 hack,可读性差
如果必须兼容老版本sklearn,FeatureUnion还能用吗
能,但仅限 scikit-learn ≤ 1.1.x,且要严格满足输入规范:
- 所有 transformer 的
fit_transform输出必须是同类型(全 sparse 或全 dense) - 确保输入 X 是 DataFrame 且每列单独封装成
FunctionTransformer(lambda x: x),否则TfidfVectorizer会报AttributeError: 'Series' object has no attribute 'lower' - 务必加
n_jobs=1,因为FeatureUnion的并行在稀疏矩阵上不稳定
示例(不推荐,仅作对照):
from sklearn.pipeline import FeatureUnion, Pipeline
from sklearn.preprocessing import FunctionTransformer
<h1>必须把每列转成独立 transformer</h1><p>text_pipe = Pipeline([("select", FunctionTransformer(lambda x: x["review"], validate=False)),
("tfidf", TfidfVectorizer())])
num_pipe = Pipeline([("select", FunctionTransformer(lambda x: x[["rating"]], validate=False)),
("scale", StandardScaler())])</p><p>union = FeatureUnion([("text", text_pipe), ("num", num_pipe)])
X_out = union.fit_transform(df) # 仍可能因类型不匹配失败
</p>
这种写法维护成本高,升级 sklearn 后必然崩。真要长期维护项目,现在就切到 ColumnTransformer。
Python免费学习笔记(深入):立即使用
在学习笔记中,你将探索 Python 的核心概念和高级技巧!











