python polars 1.44.0的官方更新日志里,列了不少弃用规则、性能优化、功能增强和问题修复。这次标记弃用的包括所有read/scan函数里的rechunk参数,expr.rechunk()方法,还有struct.rename_fields()传入字段数量不对的旧写法。如果你的项目封装了大量读取函数,这类弃用改动得尽早处理,不然升到后续版本直接会报错。

来源:Polars 官方 GitHub Releases
1.44.0的功能增强主要集中在SQL、Iceberg和执行计划三块,新增支持包括定长整数数组点积、更多join_where类型、Iceberg schema演进、原生扫描Iceberg V3删除向量、Iceberg快照属性,还有RemoteEngine通用基类。性能优化部分也做了不少调整,比如新增SQL公用表表达式缓存、join谓词下推、保留Parquet元数据、优化云服务请求重试逻辑等等。

来源:Polars 官方 GitHub Releases
这次1.44.0的修复清单也很长,覆盖了SQL子查询、AnyValue::into_static、投影下推、fastparquet导出的Parquet文件读取、CSV fallback模式下的日期时间推断等多个场景。Polars本身更新频率很高,每个次版本号升级基本都带大量底层优化,团队做版本升级的时候别只盯着新功能,一定要留意弃用警告和已知的兼容问题,有必要的话直接选后续出的补丁版更稳妥。
从Polars的更新记录能看出来,大部分改动都集中在惰性引擎、SQL模块、云服务、Iceberg、Parquet和执行计划这几个底层层面。对数据团队来说,升级验证不能只跑几个简单的DataFrame样例就完事,得覆盖真实业务查询、各类文件扫描、分组聚合、表连接、SQLContext调用、云存储读写和streaming执行路径这些场景,才能发现引擎默认逻辑或者优化器改动带来的隐性差异。
现在官方文档已经把LazyFrame、SQL、API参考、云服务/本地部署的更新内容分开维护,说明Polars早就不是单纯的单机DataFrame库了。大家选版本的时候要注意区分Python版Polars、Rust版Polars、Polars Cloud服务和预发布版,生产环境优先选稳定补丁版就行,2.0.0-rc.1这类预发布版本只适合拿来做兼容性演练。
因为Polars同一个版本里往往同时混着弃用规则、性能优化、功能新增和问题修复,升级的时候一定要把运行时的警告输出都保留下来。官方更新日志里附的PR编号也可以帮团队追溯具体改动的来源,如果升级后发现查询结果、执行计划或者内存峰值有异常,直接去对应版本的更新条目和API文档里核对原因就行。
信源说明:本文内容参考Polars官方GitHub Releases中Python Polars 1.44.0和1.43.2的页面整理;生产环境部署前,一定要结合官方最新补丁版本和自身业务的查询回归测试,再敲定最终使用的版本。
Python免费学习笔记(深入):立即使用
在学习笔记中,你将探索 Python 的核心概念和高级技巧!











