mysql默认禁用load data infile,需同时开启服务端local_infile=on(my.cnf配置)和客户端显式启用(如--local-infile=1或connect()中设local_infile=true),并确保file权限、secure_file_priv路径合规及csv格式严格匹配。

Load Data Infile 权限和配置必须提前打开
MySQL 默认禁用 LOAD DATA INFILE,即使你有 INSERT 权限也不行。不配好就执行会直接报错:ERROR 1148 (42000): The used command is not allowed with this MySQL configuration。
需要同时满足两个条件:
- 服务端开启
local_infile=ON(在my.cnf的[mysqld]和[client]段都加,或启动时带--local-infile=1) - 客户端连接时显式启用:用
mysql --local-infile=1 -u user -p连,或在连接后执行SET GLOBAL local_infile = 1(需 SUPER 权限) - 如果用 Python 的
pymysql或mysql-connector-python,得在 connect() 里传local_infile=True
CSV 文件格式与字段映射必须严格对齐
百万级数据下,字段错一位、多一个空格、引号没闭合,都会导致整批导入中断,且错误提示往往只报“line 123456”,很难定位。常见坑包括:
Miller (mlr) 是一个命令行工具,用于查询、整形和重新格式化名称索引数据,如 CSV、TSV、JSON 和 JSON Lines。它将 awk、sed、cut、join 和 sort 的功能整合到一个专为结构化数据处理而构建的单一工具中。
-
FIELDS TERMINATED BY ','不能假设 CSV 是标准逗号分隔——Excel 导出可能用;,导出工具可能用\t,务必先用head -n 1 data.csv | od -c看真实分隔符 - 含换行符的字段(比如用户评论)必须用
OPTIONALLY ENCLOSED BY '"',否则 MySQL 会把换行当成新记录 - 时间字段如
"2024-03-15 14:22:08"直接导入 datetime 列会失败,得用SET created_at = STR_TO_DATE(@created_at, '%Y-%m-%d %H:%i:%s') - 空字符串
""导入到 NOT NULL 列会报错,可加SET col = NULLIF(@col, '')
性能关键:关闭索引 + 分批 + 调整缓冲区
一次性导入百万行却保留二级索引,速度可能比逐条 INSERT 还慢。实测发现三处调整能提升 3–5 倍吞吐:
- 导入前执行
ALTER TABLE t DISABLE KEYS(仅 MyISAM 有效);InnoDB 则改用SET unique_checks=0; SET foreign_key_checks=0;,导入完再开 - 把大 CSV 拆成 50MB 左右的块(
split -l 100000 data.csv chunk_),避免单次超时或内存溢出 - 增大服务端参数:
innodb_buffer_pool_size(至少 4GB)、read_buffer_size(调到 8M)、bulk_insert_buffer_size(调到 64M)
替代方案:当 Load Data Infile 不可用时怎么救急
有些云数据库(如阿里云 RDS、AWS RDS)默认禁用 LOCAL INFILE 且无法开启。这时别硬刚,换更稳的路径:
- 用
mysqlimport命令(本质是LOAD DATA INFILE的封装),它自动处理权限协商,且支持--ignore-lines=1跳过表头 - Python +
executemany()配cursor.execute("INSERT INTO ... VALUES (%s,%s)", rows),每 10000 行 commit 一次,比单条快 50 倍以上 - 生成 SQL 文件再 source:
awk -F, '{printf "INSERT INTO t VALUES (\"%s\",\"%s\");\n", $1, $2}' data.csv > insert.sql,但注意字符转义和长度限制
真正卡住的往往不是语法,而是文件编码(UTF-8 BOM 会导致首字段乱码)、行尾符(Windows 的 \r\n 在 Linux 下可能被截断)、以及没意识到 MySQL 的 max_allowed_packet 限制了单次导入最大行数。










