如何在Python中使用sqlite3开启事务批量插入百万级数据?

星枫小哥_4673

星枫小哥_4673

2026-10-09

641人浏览

原创

直接用executemany()插入百万行仍慢,是因为默认自动提交模式导致每批执行都隐式触发事务提交和磁盘刷写;必须显式begin开启单事务、禁用synchronous、合理分批(如2000行/批)并前置pragma优化才能显著提速。

如何在python中使用sqlite3开启事务批量插入百万级数据?

为什么直接用 executemany() 插入百万行仍很慢?

因为默认情况下,sqlite3 每次 execute() 或 executemany() 都会隐式开启并提交一个事务(auto-commit mode),相当于执行了百万次 INSERT + 百万次磁盘刷写。即使关掉 isolation_level,如果没显式 BEGIN,性能依然卡在 WAL 日志同步和 fsync 上。

实操建议:

  • 必须手动用 conn.execute("BEGIN") 显式开启事务,且只开一次
  • 避免在循环里反复 commit(),哪怕每万条 commit 一次,也会显著拖慢速度
  • 关闭自动提交:初始化连接时设 isolation_level=None,否则 BEGIN 可能被忽略
  • 插入前加 conn.execute("PRAGMA synchronous = OFF")(仅开发/导入场景,生产慎用)

如何正确组织批量插入的事务边界?

事务不是越长越好——太长会导致锁表时间久、内存占用高、崩溃后回滚代价大。对百万级数据,推荐单事务 + 分批次 executemany(),而不是单条循环或全量一次性塞入。

实操建议:

  • 每 1000–5000 行调用一次 executemany(),具体看单行数据大小;1KB 左右字段建议用 2000 行/批
  • 整个百万行包裹在一个 BEGIN ... COMMIT 内,不要分段 COMMIT
  • 示例结构:
    conn.execute("BEGIN")<br>for i in range(0, len(data), 2000):<br>    batch = data[i:i+2000]<br>    conn.executemany("INSERT INTO t(x,y) VALUES (?,?)", batch)<br>conn.commit()
  • 若中途出错,靠 try/except 捕获后 conn.rollback(),别依赖自动恢复

executemany() 的参数格式踩坑点

传给 executemany() 的必须是「可迭代对象,其每个元素是长度匹配占位符的序列」,常见错误是传了 list of dict、嵌套 tuple、或字段数不一致。

testing-python
testing-python

使用pytest编写和评估有效的Python测试。适用于编写测试、审查测试代码、调试测试失败或提高测试覆盖率。

下载

常见错误现象:

  • sqlite3.ProgrammingError: Incorrect number of bindings supplied —— 某批数据里某行字段数不对
  • TypeError: parameters are of unsupported type —— 传了 dict 却没用 executemany(..., mapping=True)(但注意:原生 sqlite3 不支持 mapping=True,得用 conn.executemany("...", [tuple(d.values()) for d in data]))
  • 插入后查不到数据,但没报错 —— 实际是某批因类型不兼容静默跳过(如 None 插入非空字段),需提前校验

实操建议:

  • 插入前用 all(len(row) == expected_col_count for row in batch) 快速校验
  • 避免在循环中拼接字符串构造 SQL,始终用 ? 占位符
  • 整数/浮点数直接传,字符串确保是 str,bytes 要明确是否需 BLOB 类型

为什么开了事务还是比 MySQL / PostgreSQL 慢?还能怎么压?

SQLite 是文件数据库,没有服务端缓冲池和并行写入能力,瓶颈天然在磁盘 I/O 和单线程序列化写入。百万行插入快不快,不取决于“有没有事务”,而取决于「是否绕过了日志刷盘」和「是否用了内存页优化」。

可选优化项(按优先级排序):

  • conn.execute("PRAGMA journal_mode = MEMORY") —— 把 WAL 日志放内存,断电即丢,导入时极有效
  • conn.execute("PRAGMA temp_store = MEMORY") —— 临时表也走内存
  • conn.execute("PRAGMA cache_size = 10000") —— 增大 page cache,减少磁盘读(单位是页,默认 4KB/页)
  • 插入前建好索引?错。应该先插入,再 CREATE INDEX,否则每插一行都更新索引树

真正容易被忽略的是:这些 PRAGMA 设置必须在 BEGIN 之前执行,且对已打开的连接才生效;如果用完就 close,下次还得重设。

Python免费学习笔记(深入):立即使用
在学习笔记中,你将探索 Python 的核心概念和高级技巧!

相关文章

PHP速学视频免费教程(入门到精通)
PHP速学视频免费教程(入门到精通)

PHP怎么学习?PHP怎么入门?PHP在哪学?PHP怎么学才快?不用担心,这里为大家提供了PHP速学教程(入门到精通),有需要的小伙伴保存下载就能学习啦!

下载

相关标签:

python

本站声明:本文内容由网友自发贡献,版权归原作者所有,本站不承担相应法律责任。如您发现有涉嫌抄袭侵权的内容,请联系admin@php.cn

相关专题

更多
python打包成可执行文件
python打包成可执行文件

本专题为大家带来python打包成可执行文件相关的文章,大家可以免费的下载体验。

2023.07.20

1671

4

python能做什么
python能做什么

python能做的有:可用于开发基于控制台的应用程序、多媒体部分开发、用于开发基于Web的应用程序、使用python处理数据、系统编程等等。本专题为大家提供python相关的各种文章、以及下载和课程。

2023.07.25

4204

7

format在python中的用法
format在python中的用法

Python中的format是一种字符串格式化方法,用于将变量或值插入到字符串中的占位符位置。通过format方法,我们可以动态地构建字符串,使其包含不同值。php中文网给大家带来了相关的教程以及文章,欢迎大家前来阅读学习。

2023.07.31

1669

3

python教程
python教程

Python已成为一门网红语言,即使是在非编程开发者当中,也掀起了一股学习的热潮。本专题为大家带来python教程的相关文章,大家可以免费体验学习。

2023.08.03

24457

23

python环境变量的配置
python环境变量的配置

Python是一种流行的编程语言,被广泛用于软件开发、数据分析和科学计算等领域。在安装Python之后,我们需要配置环境变量,以便在任何位置都能够访问Python的可执行文件。php中文网给大家带来了相关的教程以及文章,欢迎大家前来学习阅读。

2023.08.04

2987

5

python eval
python eval

eval函数是Python中一个非常强大的函数,它可以将字符串作为Python代码进行执行,实现动态编程的效果。然而,由于其潜在的安全风险和性能问题,需要谨慎使用。php中文网给大家带来了相关的教程以及文章,欢迎大家前来学习阅读。

2023.08.04

3007

5

scratch和python区别
scratch和python区别

scratch和python的区别:1、scratch是一种专为初学者设计的图形化编程语言,python是一种文本编程语言;2、scratch使用的是基于积木的编程语法,python采用更加传统的文本编程语法等等。本专题为大家提供scratch和python相关的文章、下载、课程内容,供大家免费下载体验。

2023.08.11

1163

5

python合并两个列表
python合并两个列表

Python是一种强大的编程语言,具有许多方便的功能和工具。在Python中,有多种方法可以合并两个列表。php中文网给大家带来了相关的教程以及文章,欢迎大家前来学习阅读。

2023.08.10

596

4

python是前端还是后端
python是前端还是后端

Python属于前端也属于后端,其灵活性和丰富的生态系统使得开发人员能够在不同的领域中灵活运用。本专题为大家提供python相关的文章、下载、课程内容,供大家免费下载体验。

2023.08.11

2343

5

热门下载

更多
网站特效
/
网站源码
/
网站素材
/
前端模板

精品课程

更多
相关推荐
/
热门推荐
/
最新课程