
本文介绍使用 polars 库一次性抽取无放回的多个互斥随机样本,并按组求和,避免样本间数据重复,适用于大规模统计模拟场景。
本文介绍使用 polars 库一次性抽取无放回的多个互斥随机样本,并按组求和,避免样本间数据重复,适用于大规模统计模拟场景。
在统计分析或蒙特卡洛模拟中,常需对大型 DataFrame 多次抽样并计算统计量(如每组样本的和)。若直接循环调用 .sample(),默认虽为无放回(with_replacement=False),但每次调用是独立采样,因此不同轮次间可能重复选中同一行——这违背了“样本组之间完全互斥”(disjunct)的要求。
正确做法是:一次性抽取足够数量的行(N_samples × N_logs),再通过分组策略将其均匀划分为 N_samples 个不相交的子集。Polars 提供了高效、向量化的方式实现这一逻辑:
import polars as pl
import numpy as np
df = pl.DataFrame({"a": np.random.random(1000)})
N_samples = 50
N_logs = 20
# 一次性无放回抽取全部所需行,并按组编号分组求和
sums = (
df
.sample(N_samples * N_logs) # 总共抽取 1000 行(50 × 20),自动无放回
.with_row_index("idx") # (可选)添加索引便于验证,非必需
.with_columns((pl.col("idx") // N_logs).alias("group_id"))
.group_by("group_id")
.agg(pl.col("a").sum().alias("sum_a"))
.get_column("sum_a")
)
# 或更简洁写法(无需显式索引列):
sums = (
df
.sample(N_samples * N_logs)
.group_by(pl.int_range(pl.len()) // N_logs)
.sum()
.get_column("a")
)
✅ 关键原理说明:
- pl.int_range(pl.len()) 生成从 0 到 N_samples×N_logs−1 的连续整数序列;
- // N_logs 实现整除分组(如 0–19→0, 20–39→1, …),自然形成 N_samples 个大小均为 N_logs 的互斥组;
- group_by(...).sum() 在 Polars 内部以零拷贝方式完成分组聚合,性能远超 Python 循环。
⚠️ 注意事项:
- 确保 N_samples * N_logs ≤ df.height,否则 sample() 会报错(可加 error_on_insufficient=True 显式控制);
- 若需严格保持原始行顺序,可在 sample() 后链式调用 .sort("idx")(配合 with_row_index);
- 该方法本质是随机打乱后切片,兼具随机性与确定性——每组内顺序随机,组间完全隔离。
此方案不仅消除了重复采样风险,还显著提升执行效率:一次 I/O + 一次排序/分组,替代 N_samples 次独立采样与聚合,尤其在处理百万级数据时优势明显。











