如何在 Pandas 中按分组基准值对列执行二元运算(如除法)

碧海醫心

碧海醫心

2026-08-03

805人浏览

原创

如何在 Pandas 中按分组基准值对列执行二元运算(如除法)

本文介绍如何基于另一列的条件(如 quality == "normal")提取分组基准值,并将其与同组内其他行的对应列进行二元运算(如计算溢价倍数),适用于多维度分组(item + shop)场景。

本文介绍如何基于另一列的条件(如 quality == "normal")提取分组基准值,并将其与同组内其他行的对应列进行二元运算(如计算溢价倍数),适用于多维度分组(item + shop)场景。

在数据分析中,常需将某类观测值(如“稀有”品质商品价格)相对于同一分组内的基准值(如“普通”品质价格)进行标准化计算——例如计算「溢价倍数」premium = price / base_price。关键挑战在于:基准值不直接存在于当前行,而是隐藏在同 item 与同 shop 组内的特定 quality 行中。Pandas 提供了清晰、可扩展的解决方案,核心思路是:先提取基准值,再通过连接(merge)将其广播到所有匹配行,最后执行向量化运算

✅ 推荐方案:merge + assign(稳健、通用、可扩展)

该方法不依赖数据排序,支持任意数量的分组维度(如 item、shop、region 等),且逻辑直观、易于调试:

# 假设 df 已加载,包含列:item, quality, price, shop
base_df = df.query('quality == "normal"')[['item', 'shop', 'price']]
base_df = base_df.rename(columns={'price': 'price_base'})

df = (df
      .merge(base_df, on=['item', 'shop'], how='left')
      .assign(premium=lambda x: x['price'].div(x['price_base']))
)
  • query('quality == "normal"') 精准筛选出每组的基准记录;
  • [['item', 'shop', 'price']] 仅保留分组键与基准值,减少内存开销;
  • merge(..., on=['item', 'shop']) 实现左连接,自动将 price_base 广播至所有同组行;
  • assign(premium=...) 使用链式操作安全添加新列,避免原地修改风险。

⚠️ 注意事项:

  • 若某 item-shop 组不存在 quality == "normal" 的记录,price_base 将为 NaN,导致 premium 也为 NaN;建议预先校验:df.groupby(['item', 'shop']).filter(lambda g: (g['quality'] == 'normal').any())。
  • 列名冲突时可通过 suffixes=('', '_base') 显式控制后缀(如示例中 price_base)。

? 备选方案:ffill()(简洁但有前提)

当数据已严格按 item → quality(有序)→ shop 排序,且每个分组首个非空 price 必为 "normal" 时,可用更简写法:

笔灵AI答辩PPT
笔灵AI答辩PPT

答辩PPT、千字自述稿一键生成,预测导师提问,答辩一次过!

下载
df['premium'] = df['price'].div(
    df['price'].where(df['quality'] == 'normal').ffill()
)
  • where(condition) 将非 "normal" 行置为 NaN;
  • ffill() 向下填充,使每个分组内所有行获得首个 "normal" 的 price;
  • div() 执行逐元素除法。

⚠️ 风险提示:此方法强依赖排序与数据完整性。若 normal 记录缺失、位置错乱或分组键未排序,结果将错误且难以排查。生产环境优先选用 merge 方案。

? 扩展性说明

两种方案均天然支持多级分组。例如,若还需按 region 和 currency 细分,只需:

  • merge 方案:将 on=['item', 'shop'] 改为 on=['item', 'shop', 'region', 'currency'],并确保 base_df 包含全部分组键;
  • ffill 方案:需确保 sort_values(['item', 'region', 'currency', 'quality']) 且 quality 为 CategoricalDtype(categories=['normal', 'rare', 'legendary'])以保证顺序。

最终,premium 列即为各商品在各商店中相对于其“普通”品质的价格倍数,可直接用于可视化、阈值过滤或下游建模——精准、高效、一次到位。

相关专题

更多
Python 时间序列分析与预测
Python 时间序列分析与预测

本专题专注讲解 Python 在时间序列数据处理与预测建模中的实战技巧,涵盖时间索引处理、周期性与趋势分解、平稳性检测、ARIMA/SARIMA 模型构建、预测误差评估,以及基于实际业务场景的时间序列项目实操,帮助学习者掌握从数据预处理到模型预测的完整时序分析能力。

2025.12.04

149

15

Python 数据清洗与预处理实战
Python 数据清洗与预处理实战

本专题系统讲解 Python 在数据清洗与预处理中的核心技术,包括使用 Pandas 进行缺失值处理、异常值检测、数据格式化、特征工程与数据转换,结合 NumPy 高效处理大规模数据。通过实战案例,帮助学习者掌握 如何处理混乱、不完整数据,为后续数据分析与机器学习模型训练打下坚实基础。

2026.01.31

129

21

Python数据分析与Pandas高级实战
Python数据分析与Pandas高级实战

本专题围绕 Python 数据分析展开,系统讲解 Pandas 的高级用法,包括数据清洗、透视表、时间序列分析以及多表合并与分组操作。通过实战案例,帮助开发者掌握高效处理与分析数据的方法,提高数据处理效率与分析能力。

2026.04.13

69

25

墨刀AI提示词教学
墨刀AI提示词教学

本合集由PHP中文网精心整理,为您提供全面的墨刀AI提示词教学。内容涵盖高质量原型撰写公式与实操窍门,助您轻松掌握AI设计工具。无论是零基础入门还是进阶技巧,都能让您快速上手,大幅提升产品设计与协作效率。

2026.08.04

8

21

墨刀AI完整入门
墨刀AI完整入门

PHP中文网为您倾力打造墨刀AI保姆级入门指南完整版!本合集从零基础讲起,涵盖AI生成原型、提示词优化、图片转原型及多轮对话等核心功能。无论您是新手还是进阶用户,都能轻松掌握产品设计全流程。快来PHP中文网,一键解锁高效设计技巧,让想法即刻成型!

2026.08.04

3

20

墨刀AI进阶技巧
墨刀AI进阶技巧

本合集由PHP中文网精心整理,为您提供墨刀AI核心进阶策略指南。内容涵盖高效提示词写作、原型智能生成与微调、结构化导图制作及行业分析报告输出等实战技巧。助您轻松掌握AI设计工具,大幅提升产品设计与团队协作效率。

2026.08.04

7

14

火山引擎实名认证失败怎么办
火山引擎实名认证失败怎么办

火山引擎实名认证失败可能与证件信息填写错误、姓名或企业信息不一致、证件照片不清晰、营业执照状态异常、手机号验证失败或审核资料不完整有关。本专题整理个人认证、企业认证、资料上传、审核退回、重新提交和认证不通过的常见处理方法。

2026.08.04

4

10

火山引擎域名备案流程详解
火山引擎域名备案流程详解

火山引擎域名备案适合需要在火山引擎云服务器、对象存储、CDN或网站服务上绑定域名的用户参考。本专题整理备案入口、账号实名认证、备案类型选择、主体信息填写、网站信息提交、资料上传、初审核验、管局审核和备案失败排查,帮助用户完成网站上线前的备案流程。

2026.08.04

0

10

火山引擎DNS解析配置步骤
火山引擎DNS解析配置步骤

使用火山引擎DNS解析网站域名时,需要确认域名已完成管理接入,并正确配置服务器IP、CNAME地址或验证记录。本专题整理域名添加、记录类型选择、TTL设置、解析状态检查、备案和访问测试等流程,适合新手搭建网站时参考。

2026.08.04

2

10

热门下载

更多
网站特效
/
网站源码
/
网站素材
/
前端模板

精品课程

更多
相关推荐
/
热门推荐
/
最新课程
Pandas 教程
Pandas 教程

共15课时 | 1.6万人学习