如何在 Pandas DataFrame 操作中正确显示单个动态进度条

心靈之曲

心靈之曲

2026-07-31

766人浏览

原创

如何在 Pandas DataFrame 操作中正确显示单个动态进度条

本文详解为何自定义 print(..., end='\r') 进度条在 df.apply() 中会重复渲染多条,以及如何通过 tqdm 实现稳定、高效、jupyter 友好的单进度条效果。

本文详解为何自定义 print(..., end='\r') 进度条在 df.apply() 中会重复渲染多条,以及如何通过 tqdm 实现稳定、高效、jupyter 友好的单进度条效果。

在使用 pandas.DataFrame.apply() 处理大型 DataFrame(如 5000+ 行)时,若手动实现基于 print(..., end='\r') 的进度条(如示例中的 progressBar 函数),常会出现多个进度条“叠印”或“逐行刷新”的现象——这并非视觉错觉,而是由 Jupyter 输出机制与 apply 内部执行逻辑共同导致的。

根本原因在于:df.apply(func, axis=1) 默认以向量化方式分块调度(尤其在较新版本中可能触发内部优化或并行预处理),且 apply 并不保证函数调用严格按顺序同步输出;更关键的是,Jupyter 的 cell output 区域对 \r(回车符)的渲染行为受限于前端缓冲策略——当多行输出快速连续写入时,\r 无法可靠覆盖前一行,反而累积生成多个独立进度条行。而小数据集(如 100 行)因执行快、输出少,偶然“看起来”正常,实则隐患未暴露。

✅ 推荐解决方案:使用专为交互式环境优化的 tqdm 库。

燕雀光年
燕雀光年

一站式AI品牌设计平台,支持AI Logo设计、品牌VI设计、高端样机设计、AI营销设计等众多种功能

下载

tqdm 提供了针对 Jupyter Notebook/Lab 的原生支持,其 tqdm.notebook.tqdm 可渲染富文本进度条,并通过 tqdm.pandas() 将进度能力无缝注入 pandas 方法链:

from tqdm.notebook import tqdm
import pandas as pd

# 启用 pandas 集成(必须调用一次)
tqdm.pandas(desc="Processing rows")

# 定义纯函数(推荐返回新 row,避免副作用)
def myf(row):
    row = row.copy()  # 避免 SettingWithCopyWarning
    row['1'] = 100
    return row

# 替代 df.apply(...) → 使用 progress_apply
df = pd.DataFrame(index=range(0, 5000), columns=['1','2','3','4','5'])
df = df.progress_apply(myf, axis=1)

⚠️ 注意事项:

  • 勿修改原 row 对象:apply 传递的是视图(view)或副本(copy),直接赋值 row['1'] = 100 可能触发 SettingWithCopyWarning 或静默失败。务必 row.copy() 后操作并显式 return。
  • 避免全局变量:原代码中 iterator_for_progressbar 全局计数器在多线程/分块场景下不可靠,tqdm 自动管理计数,更安全。
  • 性能无损:tqdm.pandas() 的开销极低(远低于手动 sys.stdout.flush()),且支持 leave=False 等参数控制结束后是否保留进度条。
  • 兼容性:Jupyter 用户请始终导入 from tqdm.notebook import tqdm;脚本环境则用 from tqdm import tqdm。

总结:手动实现 \r 进度条在 apply 场景中本质不可靠。拥抱 tqdm.pandas() 不仅能获得美观、稳定的单进度条,还能提升代码可维护性与执行健壮性——这是数据科学工作流中的标准实践。

相关专题

更多
Python 时间序列分析与预测
Python 时间序列分析与预测

本专题专注讲解 Python 在时间序列数据处理与预测建模中的实战技巧,涵盖时间索引处理、周期性与趋势分解、平稳性检测、ARIMA/SARIMA 模型构建、预测误差评估,以及基于实际业务场景的时间序列项目实操,帮助学习者掌握从数据预处理到模型预测的完整时序分析能力。

2025.12.04

149

15

Python 数据清洗与预处理实战
Python 数据清洗与预处理实战

本专题系统讲解 Python 在数据清洗与预处理中的核心技术,包括使用 Pandas 进行缺失值处理、异常值检测、数据格式化、特征工程与数据转换,结合 NumPy 高效处理大规模数据。通过实战案例,帮助学习者掌握 如何处理混乱、不完整数据,为后续数据分析与机器学习模型训练打下坚实基础。

2026.01.31

129

21

Python数据分析与Pandas高级实战
Python数据分析与Pandas高级实战

本专题围绕 Python 数据分析展开,系统讲解 Pandas 的高级用法,包括数据清洗、透视表、时间序列分析以及多表合并与分组操作。通过实战案例,帮助开发者掌握高效处理与分析数据的方法,提高数据处理效率与分析能力。

2026.04.13

69

25

墨刀AI提示词教学
墨刀AI提示词教学

本合集由PHP中文网精心整理,为您提供全面的墨刀AI提示词教学。内容涵盖高质量原型撰写公式与实操窍门,助您轻松掌握AI设计工具。无论是零基础入门还是进阶技巧,都能让您快速上手,大幅提升产品设计与协作效率。

2026.08.04

8

21

墨刀AI完整入门
墨刀AI完整入门

PHP中文网为您倾力打造墨刀AI保姆级入门指南完整版!本合集从零基础讲起,涵盖AI生成原型、提示词优化、图片转原型及多轮对话等核心功能。无论您是新手还是进阶用户,都能轻松掌握产品设计全流程。快来PHP中文网,一键解锁高效设计技巧,让想法即刻成型!

2026.08.04

3

20

墨刀AI进阶技巧
墨刀AI进阶技巧

本合集由PHP中文网精心整理,为您提供墨刀AI核心进阶策略指南。内容涵盖高效提示词写作、原型智能生成与微调、结构化导图制作及行业分析报告输出等实战技巧。助您轻松掌握AI设计工具,大幅提升产品设计与团队协作效率。

2026.08.04

7

14

火山引擎实名认证失败怎么办
火山引擎实名认证失败怎么办

火山引擎实名认证失败可能与证件信息填写错误、姓名或企业信息不一致、证件照片不清晰、营业执照状态异常、手机号验证失败或审核资料不完整有关。本专题整理个人认证、企业认证、资料上传、审核退回、重新提交和认证不通过的常见处理方法。

2026.08.04

4

10

火山引擎域名备案流程详解
火山引擎域名备案流程详解

火山引擎域名备案适合需要在火山引擎云服务器、对象存储、CDN或网站服务上绑定域名的用户参考。本专题整理备案入口、账号实名认证、备案类型选择、主体信息填写、网站信息提交、资料上传、初审核验、管局审核和备案失败排查,帮助用户完成网站上线前的备案流程。

2026.08.04

0

10

火山引擎DNS解析配置步骤
火山引擎DNS解析配置步骤

使用火山引擎DNS解析网站域名时,需要确认域名已完成管理接入,并正确配置服务器IP、CNAME地址或验证记录。本专题整理域名添加、记录类型选择、TTL设置、解析状态检查、备案和访问测试等流程,适合新手搭建网站时参考。

2026.08.04

2

10

热门下载

更多
网站特效
/
网站源码
/
网站素材
/
前端模板

精品课程

更多
相关推荐
/
热门推荐
/
最新课程
Pandas 教程
Pandas 教程

共15课时 | 1.6万人学习

Jupyter Notebook官方文档
Jupyter Notebook官方文档

共0课时 | 0人学习