如何解决Python中NumPy数组在大数据写入数据库时的效率问题?

老墨酱_8746

老墨酱_8746

2026-06-19

892人浏览

原创

应避免直接将numpy数组传给pandas.to_sql,因其会退化为object列并逐行序列化;正确做法是显式指定列名与dtype、转为tolist()后配合executemany分批插入,并严格控制chunksize和dtype对齐以防止oom。

如何解决python中numpy数组在大数据写入数据库时的效率问题?

直接用 np.array 往数据库里塞数据,一定会卡死——NumPy 数组本身不是数据库友好的格式,必须先转换、再分批、再控制内存,否则 to_sql 会默默把整个数组转成 Python 对象列表,触发 OOM 或超长等待。

别直接传 ndarray 给 to_sql

pandas.to_sql 看似能接 np.ndarray,但实际内部会调用 pd.DataFrame 构造器,而 pd.DataFrame(arr) 在遇到非结构化 ndarray(比如 shape 是 (N,) 或 (N, M) 但无列名)时,会退化为 object 类型列,导致后续插入变成逐行 Python 对象序列化,性能断崖式下跌。

  • 错误写法:df = pd.DataFrame(my_ndarray) → 列类型是 object,to_sql 插入极慢
  • 正确做法:显式指定列名和 dtype,或用 pd.DataFrame(my_ndarray, columns=col_names).astype(dtype_dict)
  • 更稳方案:用 my_ndarray.tolist() + executemany,跳过 pandas 中间层,尤其适合已知 schema 的场景

用 executemany 前必须 flatten 和 reshape

MySQL/PostgreSQL 的 executemany 只接受二维结构:每行一个元组,每列一个值。而 np.ndarray 可能是 (1000000,)、(100000, 5, 3) 或 (200, 1000, 1000) —— 这些都不能直接喂给 executemany。

python-pro
python-pro

高级 Python 特性、异步编程、性能调优、静态类型、内存管理、Python 内部机制及生态库方面的专家。

下载
  • 一维数组:先 arr.reshape(-1, 1) 再 arr.tolist(),否则 tolist() 出来是 Python list,不是 tuple 列表
  • 高维数组:必须明确降维目标,比如 (N, C, T) 的传感器数据要写入宽表,得先 arr.reshape(N, -1);若写入长表,则需 arr.transpose(0, 2, 1).reshape(-1, C)
  • dtype 不匹配会导致 MySQL 报 TypeError: not all arguments converted,务必在 tolist() 前用 .astype(np.float64) 或 .astype(str) 强制统一

chunksize 不是越大越好,得看数据库连接和内存

to_sql(chunksize=10000) 看似吞吐高,但可能让单次 INSERT 语句过长,触发 MySQL 的 max_allowed_packet 限制(默认 4MB),或让 PostgreSQL 的 work_mem 不足,反而回滚重试。

  • 安全起点:MySQL 设为 1000,PostgreSQL 设为 5000,SQLite 设为 500(因 WAL 锁竞争剧烈)
  • 实测建议:用 arr.nbytes // chunksize 估算单批内存占用,控制在 2–5 MB 内较稳
  • 真正瓶颈常在事务提交频率——executemany 后不 commit(),所有数据压在连接缓冲区;批量插入必须配合 conn.autocommit = False + 手动 commit() 控制粒度

避免隐式 copy 导致的内存翻倍

NumPy 切片默认返回视图(view),但 astype、reshape(-1, ...)、tolist() 全都会强制生成副本。1GB 的 float32 数组调一次 astype(np.float64) 就立刻占 2GB 内存,再 tolist() 又翻倍——这是大数据入库 OOM 的最常见原因。

  • 能用 np.float32 就别升到 float64,数据库字段也配成 REAL 或 FLOAT
  • 替换 arr.astype(...).tolist() 为 arr.astype(..., copy=False).tolist()(部分 dtype 支持)
  • 终极省内存法:用 np.memmap 加载大文件,再用生成器分块 yield arr[i:i+batch].tolist(),全程不加载全量到内存

最易被忽略的是 dtype 对齐——NumPy 的 int64 写入 MySQL 的 INT 字段会触发隐式转换失败,报错信息却只显示 Incorrect integer value,排查时容易绕远路。动手前先确认数据库字段类型和 NumPy dtype 是否可无损映射。

Python免费学习笔记(深入):立即使用
在学习笔记中,你将探索 Python 的核心概念和高级技巧!

相关文章

PHP速学视频免费教程(入门到精通)
PHP速学视频免费教程(入门到精通)

PHP怎么学习?PHP怎么入门?PHP在哪学?PHP怎么学才快?不用担心,这里为大家提供了PHP速学教程(入门到精通),有需要的小伙伴保存下载就能学习啦!

下载

相关标签:

python 大数据

本站声明:本文内容由网友自发贡献,版权归原作者所有,本站不承担相应法律责任。如您发现有涉嫌抄袭侵权的内容,请联系admin@php.cn

相关专题

更多
python打包成可执行文件
python打包成可执行文件

本专题为大家带来python打包成可执行文件相关的文章,大家可以免费的下载体验。

2023.07.20

1671

4

python能做什么
python能做什么

python能做的有:可用于开发基于控制台的应用程序、多媒体部分开发、用于开发基于Web的应用程序、使用python处理数据、系统编程等等。本专题为大家提供python相关的各种文章、以及下载和课程。

2023.07.25

4184

7

format在python中的用法
format在python中的用法

Python中的format是一种字符串格式化方法,用于将变量或值插入到字符串中的占位符位置。通过format方法,我们可以动态地构建字符串,使其包含不同值。php中文网给大家带来了相关的教程以及文章,欢迎大家前来阅读学习。

2023.07.31

1669

3

python教程
python教程

Python已成为一门网红语言,即使是在非编程开发者当中,也掀起了一股学习的热潮。本专题为大家带来python教程的相关文章,大家可以免费体验学习。

2023.08.03

24217

23

python环境变量的配置
python环境变量的配置

Python是一种流行的编程语言,被广泛用于软件开发、数据分析和科学计算等领域。在安装Python之后,我们需要配置环境变量,以便在任何位置都能够访问Python的可执行文件。php中文网给大家带来了相关的教程以及文章,欢迎大家前来学习阅读。

2023.08.04

2967

5

python eval
python eval

eval函数是Python中一个非常强大的函数,它可以将字符串作为Python代码进行执行,实现动态编程的效果。然而,由于其潜在的安全风险和性能问题,需要谨慎使用。php中文网给大家带来了相关的教程以及文章,欢迎大家前来学习阅读。

2023.08.04

2987

5

scratch和python区别
scratch和python区别

scratch和python的区别:1、scratch是一种专为初学者设计的图形化编程语言,python是一种文本编程语言;2、scratch使用的是基于积木的编程语法,python采用更加传统的文本编程语法等等。本专题为大家提供scratch和python相关的文章、下载、课程内容,供大家免费下载体验。

2023.08.11

1163

5

python合并两个列表
python合并两个列表

Python是一种强大的编程语言,具有许多方便的功能和工具。在Python中,有多种方法可以合并两个列表。php中文网给大家带来了相关的教程以及文章,欢迎大家前来学习阅读。

2023.08.10

596

4

python是前端还是后端
python是前端还是后端

Python属于前端也属于后端,其灵活性和丰富的生态系统使得开发人员能够在不同的领域中灵活运用。本专题为大家提供python相关的文章、下载、课程内容,供大家免费下载体验。

2023.08.11

2323

5

热门下载

更多
网站特效
/
网站源码
/
网站素材
/
前端模板

精品课程

更多
相关推荐
/
热门推荐
/
最新课程