
本文介绍使用 python 的 csv 模块按条件合并相邻 csv 行(如将带斜杠的标题行与下方对应数据行拼接),确保列结构完整、无错位,并提供安全写入新文件的最佳实践。
本文介绍使用 python 的 csv 模块按条件合并相邻 csv 行(如将带斜杠的标题行与下方对应数据行拼接),确保列结构完整、无错位,并提供安全写入新文件的最佳实践。
在处理结构不规范的 CSV 文件时,常遇到“分两行表示同一逻辑记录”的情况:首行为带标识符(如 Superman/)的占位字段,次行为对应的实际值(如 Clark Kent),二者需纵向合并为单个单元格(如 Superman/Clark Kent),同时严格维持原有列数。Python 标准库 csv 模块完全可胜任此任务——关键在于手动控制读取器迭代,而非依赖自动逐行遍历。
以下是一个健壮、可扩展的实现方案:
import csv
# 安全地读写 CSV:输入与输出分离,避免覆盖原始数据
with (
open("input.csv", newline="") as f_in,
open("output.csv", "w", newline="") as f_out,
):
reader = csv.reader(f_in, skipinitialspace=True) # 自动去除字段前导空格
writer = csv.writer(f_out)
for row in reader:
# 判断是否为需合并的“头行”(可根据实际规则调整,如检查末尾是否含 '/')
if row and len(row) >= 3 and row[0].endswith('/'):
try:
next_row = next(reader) # 手动读取下一行
# 仅合并第0列和第2列(对应 Superman/ → Clark Kent,Batman/ → Bruce Wayne)
row[0] = row[0] + next_row[0].strip()
row[2] = row[2] + next_row[2].strip()
except StopIteration:
# 若文件以头行结尾而无配对行,可选择跳过或报错
raise ValueError("Incomplete pair: header row without matching data row")
writer.writerow(row)
✅ 关键要点说明:
- skipinitialspace=True 是必备参数,能自动清理 ", 250lbs" 中逗号后的空格,避免字段值包含意外空格;
- 使用 next(reader) 显式推进读取器,使循环自然跳过已被合并的第二行,无需额外索引管理;
- 永远优先写入新文件(如 output.csv),验证结果无误后再替换原文件,防止数据损坏;
- 合并逻辑(如 row[0] += next_row[0])应严格基于列位置对齐,本例中第0列与第2列需配对拼接,其余列(如第1、3列)保持原样,从而完美保留总列数;
- 添加基础异常处理(如 StopIteration)提升鲁棒性,避免因文件格式异常导致静默失败。
该方法不依赖外部库,兼容任意规模 CSV,且逻辑清晰、易于调试和定制(例如将判断条件从 row[0].endswith('/') 改为正则匹配,或支持多行合并)。掌握此模式后,即可灵活应对各类“跨行语义合并”场景。











