load data infile 是千万级 csv 导入唯一可靠的原生命令,需配置 secure_file_priv 和 local_infile、实测分隔符、关闭约束、调大缓冲、分块切片,并显式处理 null/时间/编码。

LOAD DATA INFILE 是唯一能真正扛住千万级 CSV 导入的原生命令,其他方式(ORM 批量插入、Workbench 向导、逐行解析)在千万行量级下基本不可用——不是超时就是 OOM 或锁表卡死。
Miller (mlr) 是一个命令行工具,用于查询、整形和重新格式化名称索引数据,如 CSV、TSV、JSON 和 JSON Lines。它将 awk、sed、cut、join 和 sort 的功能整合到一个专为结构化数据处理而构建的单一工具中。
必须先确认 secure_file_priv 和 local_infile 配置
secure_file_priv 为空或指向你文件所在目录,否则 LOAD DATA INFILE 直接报错 ERROR 1290 (HY000);local_infile 必须为 ON,否则报 ERROR 1148 (42000)。
两个参数都得配,缺一不可:
- 查看当前值:SHOW VARIABLES LIKE 'secure_file_priv'; 和 SHOW VARIABLES LIKE 'local_infile';
- 若 secure_file_priv 是非空路径(如 /var/lib/mysql-files/),CSV 文件必须放进去,且 MySQL 进程对该路径有读权限
- 若想自由指定路径,改配置文件(my.cnf 或 my.ini):
[mysqld] secure_file_priv = '' local_infile = ON然后重启 MySQL - 客户端连接时也得显式启用:
mysql --local-infile=1 -u root -p字段分隔符和换行符必须用 od -c 实测,不能猜
Excel 导出的 CSV 常用;,某些 ETL 工具用 \t,Windows 记事本保存可能带 \r\n,而 MySQL 默认只认 \n。
错一个字符,整批导入就停在第 1 行或随机某行,报错只说 Row 123456 doesn't contain data for all columns,实际是分隔符错位导致字段偏移。
正确做法:
- head -n 1 data.csv | od -c 查真实首行字节
- 若看到 015 012,说明结尾是 \r\n,得写 LINES TERMINATED BY '\r\n'
- 若第一列开头有 " 且含换行,必须加 OPTIONALLY ENCLOSED BY '"',否则 MySQL 把字段内换行当记录分隔
千万行导入前必须关约束、调缓冲、分块切片
InnoDB 在默认配置下导入千万行,速度可能比单条INSERT 还慢,因为每行都在刷索引、写日志、校验外键。
关键三步:
- 关约束:SET unique_checks=0; SET foreign_key_checks=0;(导入完再设回 1)
- 调大缓冲:SET SESSION bulk_insert_buffer_size = 512*1024*1024;(512MB),同时确保 innodb_buffer_pool_size ≥ 4GB
- 分块切片:用 split -l 500000 data.csv chunk_ 拆成 50 万行/片,避免单次超时或内存溢出;每片单独执行 LOAD DATA LOCAL INFILE,失败只重跑该片
含 NULL、时间、乱码字段必须显式转换,不能依赖自动类型推断
MySQL 对空字符串"" 导入 NOT NULL 列直接报错;对 "2024-03-15 14:22:08" 往 DATETIME 列塞会失败;GBK 编码文件不声明字符集会变乱码。
必须写完整映射:
- LOAD DATA LOCAL INFILE 'data.csv' INTO TABLE t CHARACTER SET utf8mb4 FIELDS TERMINATED BY ',' IGNORE 1 LINES (@col1,@col2,@col3) SET id = @col1, name = NULLIF(@col2, ''), created_at = STR_TO_DATE(@col3, '%Y-%m-%d %H:%i:%s');
- NULLIF(@col, '') 把空字符串转成 NULL,避开 NOT NULL 拒绝
- STR_TO_DATE() 强制解析时间,比服务端自动转换更稳
- CHARACTER SET utf8mb4 显式声明,防止 emoji 或生僻字变 ?千万行导入最易被忽略的是:错误日志里只报“line N”,但 N 是 MySQL 解析后的逻辑行号,不是原始 CSV 行号。一旦字段错位,所有后续行号全偏移,定位必须结合 od -c + 小样本测试,别靠猜。










