featureunion 自 scikit-learn 1.2 版起被弃用,1.4+ 版本中彻底移除;替代方案为 columntransformer(推荐用于按列处理)或 make_union(仅支持全量输入并行变换,需配合 functiontransformer 适配列提取)。

FeatureUnion 在 scikit-learn 中早已被弃用
直接告诉你结论:FeatureUnion 从 scikit-learn 1.2 版本起正式标记为 Deprecated,1.4+ 版本中彻底移除。你现在 pip install 的新版 sklearn 已经没有这个类了——硬写会报 ImportError: cannot import name 'FeatureUnion' from 'sklearn.pipeline'。
替代方案是 ColumnTransformer(适合按列分发处理)或更通用的 make_column_transformer / make_union,但注意:make_union 并不等价于旧 FeatureUnion,它只支持「对同一组输入数据并行调用多个 transformer」,且要求所有 transformer 都能处理完整 X(即不能像 ColumnTransformer 那样选列)。
用 make_union 替代 FeatureUnion 的正确姿势
make_union 是当前唯一保留的“并行合并”工具,但它对 transformer 的输入兼容性要求严格:每个组件都必须接受二维数组 X(shape=(n_samples, n_features)),且返回二维输出。如果你原来用 FeatureUnion 拼接 TfidfVectorizer 和 StandardScaler,现在依然可以,但要注意:
-
TfidfVectorizer默认只接受一维文本序列(fit(X)中X是 list of str),不能直接塞进make_union—— 必须先用FunctionTransformer包一层,把列抽出来 -
StandardScaler要求输入是数值型二维数组,如果原始数据混有文本列,得先分离 - 所有 transformer 的
fit_transform输出必须是稀疏或密集二维数组,且行数一致,否则numpy.hstack拼接失败
示例(假设 X 是 DataFrame,含文本列 'text' 和数值列 'age', 'income'):
from sklearn.compose import make_union from sklearn.feature_extraction.text import TfidfVectorizer from sklearn.preprocessing import StandardScaler from sklearn.preprocessing import FunctionTransformer import numpy as np <h1>提取文本列的函数</h1><p>def get_text(X): return X[:, 0] # 假设 text 是第 0 列</p><h1>提取数值列的函数</h1><p>def get_numeric(X): return X[:, 1:].astype(float)</p><p>text_pipe = make_pipeline( FunctionTransformer(get_text, validate=False), TfidfVectorizer(max_features=1000) )</p><p>num_pipe = make_pipeline( FunctionTransformer(get_numeric, validate=False), StandardScaler() )</p><h1>注意:这里传入的是原始 X(需保证列顺序稳定)</h1><p>preprocessor = make_union(text_pipe, num_pipe) X_combined = preprocessor.fit_transform(X) # X 是 numpy.ndarray 或 DataFrame </p>
ColumnTransformer 才是多数场景的真正替代品
90% 原来用 FeatureUnion 的人,其实真正需要的是按列路由(column-wise routing)——比如对字符串列做 TfidfVectorizer,对数值列做归一化,对类别列做 OneHotEncoder。这时候 ColumnTransformer 更安全、更清晰、也更不易出错。
关键点:
- 必须显式指定每组列名或列索引,例如
["text"]、["age", "income"]或slice(0, 1) - 默认
remainder="drop",漏写的列会被丢弃;设为"passthrough"可保留,但要注意类型是否下游模型能接收 - 各分支输出自动拼接,无需关心稀疏/密集混合问题(内部已处理)
- 支持命名(
transformers=[("tfidf", vec, ["text"]), ...]),便于后续用get_feature_names_out()查看特征名
性能上,ColumnTransformer 是真正并行的(可通过 n_jobs 控制),而 make_union 默认串行,除非你手动给每个 transformer 设 n_jobs 且它们本身支持。
容易踩的三个坑
第一,别在 make_union 里直接放 TfidfVectorizer——它不认 DataFrame,也不接受二维数值数组,会报 AttributeError: 'numpy.ndarray' object has no attribute 'lower'。
第二,ColumnTransformer 的列选择器在 fit 和 transform 时行为一致,但如果传入的是不同结构的测试集(比如少了一列),会直接崩,错误信息是 ValueError: Found array with dim 3. Expected ,本质是列索引越界。
第三,混合使用稀疏(如 TF-IDF)和密集(如 scaler 输出)特征后,LogisticRegression 等模型能处理,但 RandomForestClassifier 会静默转成密集数组,内存暴涨——这时候得用 scipy.sparse.hstack 手动控制格式,或统一转稠密再降维。
真正麻烦的从来不是怎么拼,而是拼完的特征矩阵形状、数据类型、缺失值状态是否稳定可预期。多打几次 X_combined.shape 和 type(X_combined),比背 API 文档有用得多。
Python免费学习笔记(深入):立即使用
在学习笔记中,你将探索 Python 的核心概念和高级技巧!











