
本文介绍在 polars 中高效生成多个互不重叠(disjunct)随机子样本的方法,避免数据重复使用,适用于统计模拟、自助法(bootstrap)变体或批量随机求和等场景。
本文介绍在 polars 中高效生成多个互不重叠(disjunct)随机子样本的方法,避免数据重复使用,适用于统计模拟、自助法(bootstrap)变体或批量随机求和等场景。
在大规模数据分析中,常需对数据进行多次随机抽样并分别计算统计量(如求和、均值)。若直接循环调用 .sample(),默认为有放回抽样(尽管 with_replacement=False 是默认值,但每次独立调用仍可能因随机性导致不同批次间样本重叠),无法保证各次样本彼此无交集——这违背了“互不重叠”(disjunct)的核心要求。
正确做法是:一次性抽取足够数量的不重复样本,再按固定大小分组聚合。具体步骤如下:
- 一次性抽取总量:需 N_samples × N_logs 个不重复行(前提是源 DataFrame 行数 ≥ 该值,否则会报错或自动降级为有放回);
- 构造分组索引:利用 pl.int_range(pl.len()) // N_logs 为每 N_logs 行分配相同组号(0, 0, …, 0, 1, 1, …, 1, …);
- 分组求和:通过 .group_by(...).sum() 得到每个样本的聚合结果,并提取列值。
import polars as pl
import numpy as np
df = pl.DataFrame({"a": np.random.random(1000)})
N_samples = 50
N_logs = 20
# ✅ 正确:一次性采样 + 分组聚合 → 严格 disjunct
sums = (
df
.sample(N_samples * N_logs, with_replacement=False) # 显式声明更清晰(虽默认即 False)
.with_row_index("group_id") # 可选:便于调试,非必需
.with_columns((pl.col("group_id") // N_logs).alias("batch"))
.group_by("batch")
.agg(pl.col("a").sum().alias("sum_a"))
.get_column("sum_a")
)
print(sums.shape) # (50,)
print(sums.head())
⚠️ 注意事项:
- 数据量检查:确保 df.height >= N_samples * N_logs,否则 sample() 会抛出 ComputeError(可加 try/except 或提前校验);
- 随机性控制:如需可复现结果,请设置 seed 参数(如 .sample(..., seed=42));
- 性能优势:相比 Python 循环 + 多次 .sample(),该方案仅触发一次底层采样与一次分组聚合,显著减少开销,尤其适合大数据集;
- 扩展性:若需其他统计量(如均值、标准差),只需替换 .agg(...) 中的表达式,例如 pl.col("a").mean()。
此方法本质是将“多次小样本”转化为“一次大样本+逻辑分块”,既满足统计独立性要求,又充分发挥 Polars 向量化与惰性计算的优势,是生产环境中推荐的标准实践。










