如何在Python 3.x中通过矢量化操作替代效率低下的iterrows循环?

雨敏酱_1665

雨敏酱_1665

2026-07-17

968人浏览

原创

iterrows() 在大数据量下极慢,因其每次返回 pandas series,触发大量 python 对象创建和类型推断,无法利用 numpy 向量化;10 万行可比向量化操作慢 50–100 倍。

如何在python 3.x中通过矢量化操作替代效率低下的iterrows循环?

为什么 iterrows() 在大数据量下会慢得明显

因为 iterrows() 每次都返回一个 Pandas Series,触发大量 Python 对象创建和类型推断,底层无法利用 NumPy 的 C 级向量化能力。10 万行数据上,它可能比等效的向量化操作慢 50–100 倍。

常见错误现象:用 for idx, row in df.iterrows(): 做数值计算、条件赋值或字符串拼接,CPU 占用高但吞吐极低;尤其当循环体内调用 row['col'] 或 row[col_name] 时,开销进一步放大。

  • 避免在 iterrows() 循环里做任何可向量化的运算(如 row['A'] + row['B'])
  • 不要用它来构造新列——直接用 df['new_col'] = df['A'] + df['B']
  • 如果必须逐行逻辑(比如依赖前一行结果),优先考虑 shift()、cumsum() 或 apply() 配合 axis=1(但注意后者仍非真正向量化)

哪些操作能直接替换 iterrows() 而不写循环

绝大多数标量运算、布尔筛选、字符串方法都有对应向量化接口,关键是识别原始逻辑是否“行独立”。

例如:你想给每行生成 status 列,规则是 “若 score > 80 且 active == True,则为 'pass',否则 'fail'”——这完全可向量化:

df['status'] = np.where((df['score'] > 80) & (df['active']), 'pass', 'fail')
  • 数值计算:df['C'] = df['A'] * 2 + df['B'].abs()
  • 条件赋值:df.loc[df['age']
  • 字符串处理:df['email_domain'] = df['email'].str.split('@').str[-1](注意 .str 方法全为向量化)
  • 时间处理:df['month'] = df['date'].dt.month

apply() 什么时候能救场,什么时候反而更慢

apply() 本身不是向量化操作,只是语法糖。它的性能取决于传入函数能否被底层优化(如内置的 sum、mean)或是否触发 Series 构造。

python-pro
python-pro

高级 Python 特性、异步编程、性能调优、静态类型、内存管理、Python 内部机制及生态库方面的专家。

下载

错误用法:df.apply(lambda row: row['A'] + row['B'], axis=1) —— 这比 iterrows() 还慢,因额外封装开销。

  • 优先用内置方法:df[['A','B']].sum(axis=1) 比 apply(sum, axis=1) 快得多
  • 若必须自定义逻辑,先尝试 numpy.where、np.select 或 pd.cut
  • 真没法避免时,确保函数接收 Series 或 ndarray,而非依赖 row['col'] 访问(改用位置索引 row.iloc[0] 稍快,但仍不推荐)

遇到“必须逐行依赖前序状态”的场景怎么办

比如计算余额:当前余额 = 上期余额 + 当期收入 - 当期支出。这类累积逻辑不能靠纯向量化一步到位,但也不该回到 iterrows()。

正确做法是识别模式并匹配 Pandas/Numpy 原生累积函数:

df['balance'] = df['income'].cumsum() - df['expense'].cumsum() + init_balance
  • 累计类:用 cumsum()、cummax()、cumprod()
  • 差分类:用 diff() 替代 row[i] - row[i-1]
  • 滚动窗口:用 rolling().mean() 等,而非手写滑动平均循环
  • 真需要复杂状态机?考虑 numba.jit 编译 Python 函数,或转成 numpy.ndarray 后用原生 NumPy 循环(此时已避开 Pandas 开销)

最易被忽略的一点:Pandas 的“向量化”本质是把操作压到底层 NumPy 数组上执行。只要你的逻辑不强制要求“按行顺序串行执行”,就几乎总能找到比 iterrows() 更快的路径——关键在拆解原始需求,而不是找“怎么让 iterrows() 快一点”。

Python免费学习笔记(深入):立即使用
在学习笔记中,你将探索 Python 的核心概念和高级技巧!

相关专题

更多
python打包成可执行文件
python打包成可执行文件

本专题为大家带来python打包成可执行文件相关的文章,大家可以免费的下载体验。

2023.07.20

1671

4

python能做什么
python能做什么

python能做的有:可用于开发基于控制台的应用程序、多媒体部分开发、用于开发基于Web的应用程序、使用python处理数据、系统编程等等。本专题为大家提供python相关的各种文章、以及下载和课程。

2023.07.25

4184

7

format在python中的用法
format在python中的用法

Python中的format是一种字符串格式化方法,用于将变量或值插入到字符串中的占位符位置。通过format方法,我们可以动态地构建字符串,使其包含不同值。php中文网给大家带来了相关的教程以及文章,欢迎大家前来阅读学习。

2023.07.31

1669

3

python教程
python教程

Python已成为一门网红语言,即使是在非编程开发者当中,也掀起了一股学习的热潮。本专题为大家带来python教程的相关文章,大家可以免费体验学习。

2023.08.03

24197

23

python环境变量的配置
python环境变量的配置

Python是一种流行的编程语言,被广泛用于软件开发、数据分析和科学计算等领域。在安装Python之后,我们需要配置环境变量,以便在任何位置都能够访问Python的可执行文件。php中文网给大家带来了相关的教程以及文章,欢迎大家前来学习阅读。

2023.08.04

2967

5

python eval
python eval

eval函数是Python中一个非常强大的函数,它可以将字符串作为Python代码进行执行,实现动态编程的效果。然而,由于其潜在的安全风险和性能问题,需要谨慎使用。php中文网给大家带来了相关的教程以及文章,欢迎大家前来学习阅读。

2023.08.04

2987

5

scratch和python区别
scratch和python区别

scratch和python的区别:1、scratch是一种专为初学者设计的图形化编程语言,python是一种文本编程语言;2、scratch使用的是基于积木的编程语法,python采用更加传统的文本编程语法等等。本专题为大家提供scratch和python相关的文章、下载、课程内容,供大家免费下载体验。

2023.08.11

1163

5

python合并两个列表
python合并两个列表

Python是一种强大的编程语言,具有许多方便的功能和工具。在Python中,有多种方法可以合并两个列表。php中文网给大家带来了相关的教程以及文章,欢迎大家前来学习阅读。

2023.08.10

596

4

python是前端还是后端
python是前端还是后端

Python属于前端也属于后端,其灵活性和丰富的生态系统使得开发人员能够在不同的领域中灵活运用。本专题为大家提供python相关的文章、下载、课程内容,供大家免费下载体验。

2023.08.11

2323

5

热门下载

更多
网站特效
/
网站源码
/
网站素材
/
前端模板

精品课程

更多
相关推荐
/
热门推荐
/
最新课程