csv读取需严格遵循rfc 4180:双引号内换行和逗号视为整体,连续双引号转义;应使用csv-parser等成熟库,手写须用状态机;sqlite导入需开事务、预编译、按列类型转换绑定,并确保utf-8编码正确处理。

CSV文件读取时换行和引号怎么处理
直接用 std::getline 按 \n 读行会崩在含换行符的字段(比如 Excel 导出的 CSV 中单元格里有回车),引号包裹的逗号也会被误切。必须按 RFC 4180 规则解析:双引号内内容视为整体,连续两个双引号表示一个字面双引号。
别手写解析器。用现成轻量库更稳,比如 csv-parser(header-only)或 rapidcsv。若坚持手写,至少先用 std::getline 读整行,再用状态机跳过引号内逗号——否则插入 SQLite 时字段错位,sqlite3_bind_text 绑定位置全乱。
- 字段含换行?必须启用“多行模式”,
csv-parser默认支持,rapidcsv需设rapidcsv::LabelParams{false, false} - 首行是标题?记下列名映射到表字段,避免硬编码列索引
- 空字段传
nullptr给sqlite3_bind_null,别传空字符串
SQLite绑定参数时类型不匹配怎么办
CSV所有字段默认是字符串,但目标表字段可能是 INTEGER 或 REAL。直接用 sqlite3_bind_text 绑所有值,会导致查询时类型隐式转换失败(比如 WHERE id = ? 中 ? 是 TEXT,索引失效)。
得按目标列类型做转换:用 std::stoi/std::stod 尝试转,捕获 std::invalid_argument 后 fallback 到 NULL 或原字符串。别依赖 SQLite 的自动类型转换——它只在比较时生效,建索引、约束检查都认真实类型。
- 整数列:用
std::strtol+endptr判是否全数字,比stoi更准(避免 "123abc" 被截断接受) - 时间列(如
TEXT存 "2024-03-15"):保持字符串,SQLite 的date()函数能认;若要存为INTEGER时间戳,用std::get_time解析后转time_t - 布尔列:CSV 常见 "true"/"false"、"1"/"0"、"yes"/"no",统一映射为
int后用sqlite3_bind_int
大批量导入如何避免慢成蜗牛
逐行 INSERT INTO table VALUES (?, ?, ?) 执行,每条都是独立事务,磁盘 I/O 拖垮性能。10 万行可能跑几分钟。
必须开事务 + 预编译语句 + 批量绑定。用 BEGIN IMMEDIATE 启动事务,预编译一次 INSERT 语句,循环调用 sqlite3_bind_* + sqlite3_step + sqlite3_reset,最后 COMMIT。实测 10 万行从分钟级降到秒级。
- 禁用同步:
PRAGMA synchronous = OFF(仅开发/导入时用,丢数据风险) - 加大页缓存:
PRAGMA cache_size = 10000,减少磁盘读 - 关日志模式:
PRAGMA journal_mode = MEMORY(内存日志,重启即丢) - 每 500 行
sqlite3_reset一次,防内存累积(尤其字段长时)
中文路径或 UTF-8 字段乱码怎么解
Windows 下用 std::ifstream 读 CSV,若文件是 UTF-8 无 BOM,getline 会把中文当多个 char 拆开,后续绑定到 SQLite 就是乱码。SQLite 内部用 UTF-8,但输入接口不校验编码。
关键点:确保 CSV 文件确实是 UTF-8 编码(Notepad++ 可查),且 C++ 读取时按字节流处理,不经过 locale 转码。用 std::ifstream 构造时加 std::ios::binary 标志,读出的 std::string 直接喂给 sqlite3_bind_text(第四个参数设 SQLITE_STATIC 或 SQLITE_TRANSIENT,别用 -1)。
- Windows 上避免用
_wfopen读宽字符——SQLite 不吃 wchar_t - 表名/列名含中文?用双引号括起来:
INSERT INTO "用户表" ("姓名") VALUES (?) - 执行
PRAGMA encoding = "UTF-8"确保数据库编码一致(新建库时默认就是)
;)、引号缺失、BOM 头干扰、数值带千分位符。先用 Python 快速清洗一遍,比在 C++ 里补丁式处理强得多。C++免费学习笔记(深入):立即使用
在学习笔记中,你将探索 C++ 的入门与实战技巧!











