如何从 DataFrame 中高效生成互不重叠的多个随机样本

碧海醫心

碧海醫心

2026-08-03

887人浏览

原创

如何从 DataFrame 中高效生成互不重叠的多个随机样本

本文介绍使用 polars 一次性抽取无放回的批量样本,并按组求和,确保每个数据点仅被使用一次,避免传统循环采样导致的重复问题。

本文介绍使用 polars 一次性抽取无放回的批量样本,并按组求和,确保每个数据点仅被使用一次,避免传统循环采样导致的重复问题。

在统计分析或蒙特卡洛模拟中,常需对大规模 DataFrame 多次随机抽样并计算统计量(如每组样本的和)。若采用循环调用 df.sample()(如原代码所示),默认虽为无放回,但每次调用独立采样,无法保证不同样本间互斥——即同一行可能被多次选中,违背“disjunct”(互不相交)要求。

正确做法是:一次性抽取全部所需数据点,再均匀划分成互斥子组。Polars 提供了高效、向量化的方式实现该逻辑:

import polars as pl
import numpy as np

df = pl.DataFrame({"a": np.random.random(1000)})

N_samples = 50
N_logs = 20  # 每个样本含 20 行

# ✅ 正确:一次性抽取 N_samples × N_logs 行(无放回),再分组求和
sums = (
    df.sample(N_samples * N_logs, with_replacement=False)  # 显式指定更清晰(默认即 False)
    .with_row_index()  # 可选:便于理解分组逻辑(实际可用 int_range 替代)
    .with_columns(pl.int_range(pl.len()) // N_logs)  # 生成组 ID:0,0,...,0, 1,1,...,1, ...
    .group_by(pl.col("literal"))  # 按组 ID 分组(列名取决于 Polars 版本,推荐用列索引或重命名)
    .agg(pl.col("a").sum())
    .get_column("a")
)

更简洁且推荐的写法(与答案一致,利用 pl.int_range(pl.len()) 直接构造分组键):

雀塔AI
雀塔AI

一站式工作流开发服务平台,从开发配置到推广分成,从AI创意到落地变现全搞定。

下载
sums = (
    df.sample(N_samples * N_logs)
    .group_by(pl.int_range(pl.len()) // N_logs)
    .sum()
    .get_column("a")
)

关键要点说明

  • sample(n) 默认 with_replacement=False,确保全局唯一抽样;
  • pl.int_range(pl.len()) // N_logs 生成形如 [0,0,…,0, 1,1,…,1, …, 49,49,…,49] 的整数序列,长度为 N_samples * N_logs,自然将样本划分为 N_samples 组,每组 N_logs 行;
  • group_by(...).sum() 向量化聚合,性能远超 Python 循环 + 多次 sample();
  • 最终 .get_column("a") 返回长度为 N_samples 的 Series,每个元素即对应组的 a 列之和。

⚠️ 注意事项

  • 确保 N_samples * N_logs ≤ df.height,否则 sample() 会报错(可加 error_on_insufficient=True 显式控制);
  • 若需保留原始行索引或元信息,可在 sample() 后使用 with_row_index() 并在分组中一并保留;
  • 该方法本质是随机打乱后切片,等价于 df.sample(...).partition_by(...) 的高效替代。

此方案兼顾正确性、性能与简洁性,是 Polars 生态下处理互斥多样本统计任务的标准实践。

PHP速学视频免费教程(入门到精通)
PHP速学视频免费教程(入门到精通)

PHP怎么学习?PHP怎么入门?PHP在哪学?PHP怎么学才快?不用担心,这里为大家提供了PHP速学教程(入门到精通),有需要的小伙伴保存下载就能学习啦!

下载

相关标签:

本站声明:本文内容由网友自发贡献,版权归原作者所有,本站不承担相应法律责任。如您发现有涉嫌抄袭侵权的内容,请联系admin@php.cn

相关专题

更多
Python 时间序列分析与预测
Python 时间序列分析与预测

本专题专注讲解 Python 在时间序列数据处理与预测建模中的实战技巧,涵盖时间索引处理、周期性与趋势分解、平稳性检测、ARIMA/SARIMA 模型构建、预测误差评估,以及基于实际业务场景的时间序列项目实操,帮助学习者掌握从数据预处理到模型预测的完整时序分析能力。

2025.12.04

149

15

Python 数据清洗与预处理实战
Python 数据清洗与预处理实战

本专题系统讲解 Python 在数据清洗与预处理中的核心技术,包括使用 Pandas 进行缺失值处理、异常值检测、数据格式化、特征工程与数据转换,结合 NumPy 高效处理大规模数据。通过实战案例,帮助学习者掌握 如何处理混乱、不完整数据,为后续数据分析与机器学习模型训练打下坚实基础。

2026.01.31

129

21

Python数据分析与Pandas高级实战
Python数据分析与Pandas高级实战

本专题围绕 Python 数据分析展开,系统讲解 Pandas 的高级用法,包括数据清洗、透视表、时间序列分析以及多表合并与分组操作。通过实战案例,帮助开发者掌握高效处理与分析数据的方法,提高数据处理效率与分析能力。

2026.04.13

69

25

墨刀AI提示词教学
墨刀AI提示词教学

本合集由PHP中文网精心整理,为您提供全面的墨刀AI提示词教学。内容涵盖高质量原型撰写公式与实操窍门,助您轻松掌握AI设计工具。无论是零基础入门还是进阶技巧,都能让您快速上手,大幅提升产品设计与协作效率。

2026.08.04

3

21

墨刀AI完整入门
墨刀AI完整入门

PHP中文网为您倾力打造墨刀AI保姆级入门指南完整版!本合集从零基础讲起,涵盖AI生成原型、提示词优化、图片转原型及多轮对话等核心功能。无论您是新手还是进阶用户,都能轻松掌握产品设计全流程。快来PHP中文网,一键解锁高效设计技巧,让想法即刻成型!

2026.08.04

1

20

墨刀AI进阶技巧
墨刀AI进阶技巧

本合集由PHP中文网精心整理,为您提供墨刀AI核心进阶策略指南。内容涵盖高效提示词写作、原型智能生成与微调、结构化导图制作及行业分析报告输出等实战技巧。助您轻松掌握AI设计工具,大幅提升产品设计与团队协作效率。

2026.08.04

3

14

火山引擎实名认证失败怎么办
火山引擎实名认证失败怎么办

火山引擎实名认证失败可能与证件信息填写错误、姓名或企业信息不一致、证件照片不清晰、营业执照状态异常、手机号验证失败或审核资料不完整有关。本专题整理个人认证、企业认证、资料上传、审核退回、重新提交和认证不通过的常见处理方法。

2026.08.04

2

10

火山引擎域名备案流程详解
火山引擎域名备案流程详解

火山引擎域名备案适合需要在火山引擎云服务器、对象存储、CDN或网站服务上绑定域名的用户参考。本专题整理备案入口、账号实名认证、备案类型选择、主体信息填写、网站信息提交、资料上传、初审核验、管局审核和备案失败排查,帮助用户完成网站上线前的备案流程。

2026.08.04

0

10

火山引擎DNS解析配置步骤
火山引擎DNS解析配置步骤

使用火山引擎DNS解析网站域名时,需要确认域名已完成管理接入,并正确配置服务器IP、CNAME地址或验证记录。本专题整理域名添加、记录类型选择、TTL设置、解析状态检查、备案和访问测试等流程,适合新手搭建网站时参考。

2026.08.04

0

10

热门下载

更多
网站特效
/
网站源码
/
网站素材
/
前端模板

精品课程

更多
热门推荐
/
最新课程
phpStudy极速入门视频教程
phpStudy极速入门视频教程

共6课时 | 54.4万人学习

独孤九贱(4)_PHP视频教程
独孤九贱(4)_PHP视频教程

共89课时 | 131.8万人学习