如何将 DataFrame 中成对列值展开为两列组合

胖枫小哥_8852

胖枫小哥_8852

2026-07-05

457人浏览

原创

本文介绍使用 pandas 的 groupby + itertools.combinations 高效生成组内所有两两组合,并将原始列(如 b_m、b_n)分别拆分为对应的新列对(b_m1/b_m2、b_n1/b_n2),自动过滤单行组,适用于特征工程与配对分析场景。

本文介绍使用 pandas 的 groupby + itertools.combinations 高效生成组内所有两两组合,并将原始列(如 b_m、b_n)分别拆分为对应的新列对(b_m1/b_m2、b_n1/b_n2),自动过滤单行组,适用于特征工程与配对分析场景。

在数据分析中,常需将同一分组下的多个观测两两配对,用于计算相似性、构建边关系或生成交互特征。例如,给定按 Group 分组的 DataFrame,要求对每组内 B_m 和 B_n 列的所有元素生成所有无序二元组合(即 itertools.combinations(..., r=2)),并将每对值分别存入新列 B_m1/B_m2 和 B_n1/B_n2,同时保留其他分组键列(如 A_x, A_y)。单行组会被自动排除,多行组则完整展开所有唯一组合。

以下是推荐的高效实现方案(避免显式循环,充分利用 pandas 向量化与分组操作):

import pandas as pd
from itertools import combinations

# 构造示例数据
df = pd.DataFrame(
    data=[
        [0, 4, 7, -1, 0.9],
        [0, 4, 7, 0, 0.3],
        [0, 4, 7, 1, 0.2],
        [1, 3, 3, 1, 0.5],
        [1, 3, 3, 0, 0.2],
        [2, 1, 8, 0, 0.6],
    ],
    columns=['Group', 'A_x', 'A_y', 'B_m', 'B_n'],
)

# 定义需展开的列名及分组列
cols_to_expand = ['B_m', 'B_n']
group_cols = list(df.columns.difference(cols_to_expand, sort=False))

# 核心逻辑:按 group_cols 分组,对每列应用 combinations,重命名并拼接
g = df.groupby(group_cols, sort=False)

result = pd.concat([
    g[col].apply(lambda x: pd.DataFrame(list(combinations(x, r=2))))
       .rename(columns=lambda i: f'{col}{i+1}')
    for col in cols_to_expand
], axis=1).reset_index(group_cols)

print(result)

输出结果:

KreadoAI
KreadoAI

KreadoAI是一款AI文本写作工具,AI数字人视频营销创作平台。

下载
   Group  A_x  A_y  B_m1  B_m2  B_n1  B_n2
0      0    4    7  -1.0   0.0   0.9   0.3
1      0    4    7  -1.0   1.0   0.9   0.2
2      0    4    7   0.0   1.0   0.3   0.2
3      1    3    3   1.0   0.0   0.5   0.2

✅ 关键优势说明:

  • 自动去单行组:combinations(x, 2) 对长度
  • 严格保持组内结构:groupby(..., sort=False) 保留原始顺序,reset_index(group_cols) 确保分组键列正确还原;
  • 列名自动映射:rename(columns=lambda i: f'{col}{i+1}') 将组合索引 0→1, 1→2 映射为 B_m1, B_m2 等;
  • 可扩展性强:只需修改 cols_to_expand 列表即可支持任意多列同步展开。

⚠️ 注意事项:

  • 若原始数据含缺失值(NaN),combinations 会将其视作普通值参与组合;如需剔除,建议预处理:df.dropna(subset=cols_to_expand);
  • 组合数随组大小呈 O(n²) 增长,对超大组(如 n > 1000)可能内存压力显著,此时建议加 if len(x) >= 2: 判断或改用生成器分批处理;
  • 列名冲突风险:确保 cols_to_expand 中列名不含数字后缀,避免重命名冲突(如 B_m1 已存在)。

该方法简洁、健壮且符合 pandas 惯用范式,是处理“组内两两配对展开”任务的标准实践。

PHP速学视频免费教程(入门到精通)
PHP速学视频免费教程(入门到精通)

PHP怎么学习?PHP怎么入门?PHP在哪学?PHP怎么学才快?不用担心,这里为大家提供了PHP速学教程(入门到精通),有需要的小伙伴保存下载就能学习啦!

下载

相关标签:

本站声明:本文内容由网友自发贡献,版权归原作者所有,本站不承担相应法律责任。如您发现有涉嫌抄袭侵权的内容,请联系admin@php.cn

相关专题

更多
Python 时间序列分析与预测
Python 时间序列分析与预测

本专题专注讲解 Python 在时间序列数据处理与预测建模中的实战技巧,涵盖时间索引处理、周期性与趋势分解、平稳性检测、ARIMA/SARIMA 模型构建、预测误差评估,以及基于实际业务场景的时间序列项目实操,帮助学习者掌握从数据预处理到模型预测的完整时序分析能力。

2025.12.04

320

15

Python 数据清洗与预处理实战
Python 数据清洗与预处理实战

本专题系统讲解 Python 在数据清洗与预处理中的核心技术,包括使用 Pandas 进行缺失值处理、异常值检测、数据格式化、特征工程与数据转换,结合 NumPy 高效处理大规模数据。通过实战案例,帮助学习者掌握 如何处理混乱、不完整数据,为后续数据分析与机器学习模型训练打下坚实基础。

2026.01.31

232

21

Python数据分析与Pandas高级实战
Python数据分析与Pandas高级实战

本专题围绕 Python 数据分析展开,系统讲解 Pandas 的高级用法,包括数据清洗、透视表、时间序列分析以及多表合并与分组操作。通过实战案例,帮助开发者掌握高效处理与分析数据的方法,提高数据处理效率与分析能力。

2026.04.13

451

25

FrankenPHP集成Laravel详细教程
FrankenPHP集成Laravel详细教程

本专题提供FrankenPHP集成Laravel的详细配置指南,全面解析运行原理、开发环境搭建、Caddyfile配置、Octane工作模式、数据库连接、队列任务、定时任务和生产环境优化,解决部署过程中常见的报错与兼容性问题。

2026.10.08

40

20

LLVM自定义Pass怎么写
LLVM自定义Pass怎么写

本专题聚焦LLVM自定义Pass开发,整理Pass类结构、run()方法、PreservedAnalyses、CMake构建、插件注册、-load-pass-plugin加载和测试用例编写流程。

2026.09.30

140

10

LLVM RISC-V参数配置教程
LLVM RISC-V参数配置教程

本专题介绍LLVM对RISC-V基础ISA和扩展的支持方式,涵盖RV32、RV64、标准扩展、实验性扩展、厂商扩展、-menable-experimental-extensions和版本差异。

2026.09.30

140

14

LLVM IR中间表示入门指南
LLVM IR中间表示入门指南

本专题整理LLVM IR的核心概念,包括中间表示作用、模块结构、函数、基本块、SSA形式、类型系统和常见语法,帮助新手理解LLVM编译流程中的关键层。

2026.09.30

100

12

PDF转图片方法
PDF转图片方法

需要把 PDF 页面用于上传、预览、分享或图片归档时,PDF 转图片方法专题整理 JPG/PNG 格式选择、逐页导出、清晰度设置、批量下载和结果检查等流程,帮助用户稳定完成 PDF 图片化处理。

2026.09.30

100

26

PixTV AI视频生成与无限画布创作
PixTV AI视频生成与无限画布创作

PixTV专题整理AI视频与视觉内容创作相关功能使用教程,涵盖AI生图、视频生成、无限画布、多模型创作、素材管理、声音音乐及视频剪辑等功能,帮助用户快速掌握PixTV从创意到成片的完整制作方法。

2026.09.29

120

15

热门下载

更多
网站特效
/
网站源码
/
网站素材
/
前端模板

精品课程

更多
热门推荐
/
最新课程
phpStudy极速入门视频教程
phpStudy极速入门视频教程

共6课时 | 54.6万人学习

独孤九贱(4)_PHP视频教程
独孤九贱(4)_PHP视频教程

共89课时 | 133.4万人学习