Python中如何提升大规模数据处理效率_对比Pandas 2.0与Polars性能差异

阿墨吖_8503

阿墨吖_8503

2026-05-09

350人浏览

原创

pl.read_parquet()比pd.read_parquet()快近5倍,因polars默认多线程io、列式预读、免类型推断,而pandas需整列内存拷贝与dtype转换;惰性模式pl.scan_parquet()可减少39%耗时。

python中如何提升大规模数据处理效率_对比pandas 2.0与polars性能差异

读取10GB Parquet时,pl.read_parquet() 比 pd.read_parquet() 快近5倍

不是所有“快”都发生在计算阶段——IO瓶颈常被低估。实测240M行Parquet(约10GB)在MacBook Pro M2 Max上:pl.read_parquet() 耗时8.7秒,pd.read_parquet()(Pandas 2.2.1 + PyArrow 15.0.2)耗时41.2秒。关键差异不在代码写法,而在底层行为:

  • Polars默认启用多线程IO和列式预读,只加载元数据+所需列schema,跳过类型推断
  • Pandas即使使用PyArrow后端,仍需将Arrow表转为NumPy数组,触发整列内存拷贝与dtype转换
  • 若数据含大量字符串或嵌套结构,Pandas的object列构造开销会进一步放大延迟

实操建议:对Parquet文件,直接用pl.read_parquet();若后续必须进pandas,用.to_pandas()而非先转DataFrame再调pd.DataFrame()构造器。

过滤+聚合链式操作中,filter() + group_by().agg() 在Polars里是单次扫描

常见错误是把Polars当pandas写:df.filter(...).group_by(...).agg(...) 看似合理,但若没启用惰性模式,它仍是立即执行——而真正省时间的是pl.scan_parquet()构建的计划树。对比实测(240M行):

  • 立即模式:pl.read_parquet().filter(...).group_by(...).agg(...) —— 1.8秒
  • 惰性模式:pl.scan_parquet().filter(...).group_by(...).agg(...).collect() —— 1.1秒(减少39%)
  • pandas等价链:df[df.x > 100].groupby('y').z.agg(['mean', 'std']) —— 18.4秒

原因:惰性模式下Polars能合并filter与agg谓词,跳过不满足条件的row group;pandas每次操作都生成新DataFrame,中间结果全驻内存。注意:.collect()前所有操作不触发计算,调试时别误以为“没运行”。

testing-python
testing-python

使用pytest编写和评估有效的Python测试。适用于编写测试、审查测试代码、调试测试失败或提高测试覆盖率。

下载

小数据量(pd.read_csv() 反而比 pl.read_csv() 更快

Polars启动有Rust运行时编译与线程池初始化开销。在百万行CSV测试中(约120MB),pd.read_csv()平均耗时0.41秒,pl.read_csv()为0.53秒——慢了29%。这不是bug,是设计取舍:

  • Polars为并行IO优化了chunk分发逻辑,但小文件无法摊薄调度成本
  • Pandas对小CSV做了多年缓存与Cython路径特化,冷启动更轻量
  • 若后续要接matplotlib或scikit-learn,pandas原生兼容免转换,反而省去.to_pandas()的序列化开销

实操建议:自动分流——用os.path.getsize()预估文件大小,

to_pandas() 不等于零拷贝,大表转换时内存峰值可能翻倍

很多人以为df_pl.to_pandas()只是换个壳,实际它是深拷贝:Arrow内存布局 → NumPy数组 → pandas BlockManager重构。实测10GB Polars DataFrame转pandas,内存峰值达22GB(+120%)。

  • 根本原因是pandas的object dtype存储字符串时用Python str对象,每个值带引用头;Polars用紧凑UTF-8 slice共享内存
  • 若只需部分列进pandas,用.select([col1, col2]).to_pandas(),避免加载无关列
  • 极端情况可考虑pl.DataFrame.to_numpy() + 手动构造pandas DataFrame,绕过object列陷阱

真正省内存的协作方式不是“转来转去”,而是让Polars做完ETL、pandas只接手最终特征表——这个边界划在哪,比选库更重要。

Python免费学习笔记(深入):立即使用
在学习笔记中,你将探索 Python 的核心概念和高级技巧!

相关文章

数码产品性能查询
数码产品性能查询

该软件包括了市面上所有手机CPU,手机跑分情况,电脑CPU,电脑产品信息等等,方便需要大家查阅数码产品最新情况,了解产品特性,能够进行对比选择最具性价比的商品。

下载

相关标签:

python

本站声明:本文内容由网友自发贡献,版权归原作者所有,本站不承担相应法律责任。如您发现有涉嫌抄袭侵权的内容,请联系admin@php.cn

相关专题

更多
python打包成可执行文件
python打包成可执行文件

本专题为大家带来python打包成可执行文件相关的文章,大家可以免费的下载体验。

2023.07.20

1691

4

python能做什么
python能做什么

python能做的有:可用于开发基于控制台的应用程序、多媒体部分开发、用于开发基于Web的应用程序、使用python处理数据、系统编程等等。本专题为大家提供python相关的各种文章、以及下载和课程。

2023.07.25

4284

7

format在python中的用法
format在python中的用法

Python中的format是一种字符串格式化方法,用于将变量或值插入到字符串中的占位符位置。通过format方法,我们可以动态地构建字符串,使其包含不同值。php中文网给大家带来了相关的教程以及文章,欢迎大家前来阅读学习。

2023.07.31

1689

3

python教程
python教程

Python已成为一门网红语言,即使是在非编程开发者当中,也掀起了一股学习的热潮。本专题为大家带来python教程的相关文章,大家可以免费体验学习。

2023.08.03

24917

23

python环境变量的配置
python环境变量的配置

Python是一种流行的编程语言,被广泛用于软件开发、数据分析和科学计算等领域。在安装Python之后,我们需要配置环境变量,以便在任何位置都能够访问Python的可执行文件。php中文网给大家带来了相关的教程以及文章,欢迎大家前来学习阅读。

2023.08.04

3047

5

python eval
python eval

eval函数是Python中一个非常强大的函数,它可以将字符串作为Python代码进行执行,实现动态编程的效果。然而,由于其潜在的安全风险和性能问题,需要谨慎使用。php中文网给大家带来了相关的教程以及文章,欢迎大家前来学习阅读。

2023.08.04

3067

5

scratch和python区别
scratch和python区别

scratch和python的区别:1、scratch是一种专为初学者设计的图形化编程语言,python是一种文本编程语言;2、scratch使用的是基于积木的编程语法,python采用更加传统的文本编程语法等等。本专题为大家提供scratch和python相关的文章、下载、课程内容,供大家免费下载体验。

2023.08.11

1163

5

python合并两个列表
python合并两个列表

Python是一种强大的编程语言,具有许多方便的功能和工具。在Python中,有多种方法可以合并两个列表。php中文网给大家带来了相关的教程以及文章,欢迎大家前来学习阅读。

2023.08.10

596

4

python是前端还是后端
python是前端还是后端

Python属于前端也属于后端,其灵活性和丰富的生态系统使得开发人员能够在不同的领域中灵活运用。本专题为大家提供python相关的文章、下载、课程内容,供大家免费下载体验。

2023.08.11

2383

5

热门下载

更多
网站特效
/
网站源码
/
网站素材
/
前端模板

精品课程

更多
相关推荐
/
热门推荐
/
最新课程