本文介绍在 Polars 中通过 pl.col(['x', 'y']) 批量指定多列,结合表达式运算实现统一加权聚合(如按 num_obs 加权平均),并无缝整合其他独立聚合(如 sum),避免循环、提升可读性与性能。
本文介绍在 polars 中通过 `pl.col(['x', 'y'])` 批量指定多列,结合表达式运算实现统一加权聚合(如按 `num_obs` 加权平均),并无缝整合其他独立聚合(如 `sum`),避免循环、提升可读性与性能。
在 Polars 中,对多个数值列执行结构完全一致的聚合逻辑(例如:按 num_obs 加权求平均),无需借助 Python 循环或重复书写表达式。核心技巧是利用 pl.col() 支持传入列名列表这一特性,使表达式自动广播到所有指定列。
以示例数据为例:
import polars as pl
df = pl.DataFrame({
'group': [1, 1, 2, 2],
'other': ['a', 'b', 'a', 'b'],
'num_obs': [10, 5, 20, 10],
'x': [1, 2, 3, 4],
'y': [5, 6, 7, 8],
})
目标是:按 'group' 分组,对 'x' 和 'y' 同时计算 加权平均值(权重为 'num_obs'),并额外统计每组 'num_obs' 的总和。
✅ 推荐写法(简洁、高效、可扩展):
result = df.group_by('group').agg(
# 对 x 和 y 同时应用加权平均:(col * num_obs).sum() / num_obs.sum()
(pl.col('x', 'y') * pl.col('num_obs')).sum() / pl.col('num_obs').sum(),
# 同时添加其他独立聚合(不参与广播)
pl.col('num_obs').sum().alias('total_num_obs'),
)
print(result)
输出:
shape: (2, 4) ┌───────┬──────────┬──────────┬─────────────────┐ │ group ┆ x ┆ y ┆ total_num_obs │ │ --- ┆ --- ┆ --- ┆ --- │ │ i64 ┆ f64 ┆ f64 ┆ i64 │ ╞═══════╪══════════╪══════════╪═════════════════╡ │ 1 ┆ 1.333333 ┆ 5.333333 ┆ 15 │ │ 2 ┆ 3.333333 ┆ 7.333333 ┆ 30 │ └───────┴──────────┴──────────┴─────────────────┘
? 关键原理说明:
- pl.col('x', 'y') 返回一个列选择器表达式,当与标量运算(如 * pl.col('num_obs'))结合时,Polars 自动将该运算广播至 'x' 和 'y' 两列,分别生成 (x * num_obs) 和 (y * num_obs);
- .sum() 随后对每个广播结果独立求和,再除以 pl.col('num_obs').sum()(标量分母),最终返回同名新列 'x' 和 'y';
- 其他聚合(如 pl.col('num_obs').sum())可自由并列添加,互不影响,且支持 .alias() 显式重命名。
⚠️ 注意事项:
- 列名必须全部存在,否则抛出 ColumnNotFoundError;建议使用 pl.col(['x','y'])(列表形式)提高可读性与类型安全;
- 若需对不同列应用不同权重或逻辑,则应回归 pl.all() + pl.when() 或自定义函数(配合 map_elements),但会损失性能;
- 此方法仅适用于表达式可向量化的场景——加权平均、标准化、比例计算等均属典型适用案例。
总结:用 pl.col(['col1', 'col2']) 替代循环构造表达式,是 Polars 中实现多列统一批处理的惯用范式,兼具简洁性、性能与可维护性,应作为首选方案。











