unicodedecodeerror主因是编码声明与文件实际格式不匹配:utf-8-sig文件含bom(\xef\xbb\xbf),必须用utf-8-sig读取才能自动剥离,否则bom被误作字符导致解码失败;pandas中还需指定engine='python'使encoding生效,或统一保存/读取编码避免混用。

Python读CSV报UnicodeDecodeError,不是编码写错了,是读的方式没对上
常见现象是:用 encoding='utf-8-sig' 保存的CSV,再用 open(..., encoding='utf-8') 去读,依然报错 UnicodeDecodeError: 'utf-8' codec can't decode byte 0xef in position 0。这不是文件坏了,而是你读的时候没让 Python 知道开头有 BOM。
UTF-8-sig 的本质是在文件开头写入三个字节 \xef\xbb\xbf(即 BOM),告诉支持它的程序“这是 UTF-8”。但 Python 的 utf-8 编码器默认不跳过 BOM;而 utf-8-sig 编码器会自动识别并剥离它。
- 保存时用
utf-8-sig→ 文件带 BOM - 读取时必须也用
utf-8-sig,否则 BOM 被当普通字符读,导致解码失败 - 如果读取时硬用
utf-8,开头那三个字节就会卡在第一行字段名里,比如列名变成\ufeff姓名,后续所有字段偏移
pandas.read_csv 读中文乱码,别只改encoding参数
很多人加了 encoding='utf-8-sig' 还是乱码,是因为 pandas.read_csv 在底层用了 C engine,默认忽略 encoding 参数——它只对 Python engine 生效。
解决办法只有两个明确路径:
- 显式指定
engine='python',再配encoding='utf-8-sig' - 或者干脆不用
encoding,改用encoding_errors='replace'+engine='c'(仅作容错,不推荐用于生产)
正确写法示例:
import pandas as pd
df = pd.read_csv('data.csv', encoding='utf-8-sig', engine='python')
注意:如果 CSV 是用 pandas.to_csv(..., encoding='gbk') 保存的,读的时候也得用 gbk,不能混用。
用 csv 模块写入后 Excel 双击打开正常,但 Python 再读就出错
这是典型的 BOM “副作用”:Excel 靠 BOM 自动识别 UTF-8,但 Python 的 csv.reader 不处理 BOM,会把 \ufeff 当成第一列字段名的第一个字符。
使用 qbo-mileage CLI 及用户凭证,从 Airtable、Outlook 或 Google Calendar 记录生成 QuickBooks Online 里程 CSV 文件。
现象:next(reader) 返回的是 ['\ufeff姓名', '年龄'] 而不是 ['姓名', '年龄']。
绕过方式很简单:
- 写入时坚持用
utf-8-sig - 读取时也用
utf-8-sig,BOM 就会被自动剥离,不会进数据 - 不要手动用
open().read().replace()去删 BOM——容易误删文本里的合法\ufeff
错误示范(别这么干):
with open('data.csv', encoding='utf-8') as f:
content = f.read().replace('\ufeff', '')
爬虫落地 CSV 时,encoding='utf-8-sig' 不是万能解药
如果你的原始网页响应头声明的是 charset=gb2312,而你用 response.text 直接取内容、再塞进 utf-8-sig 文件,那乱码根源其实在解析阶段,不是保存阶段。
关键检查点:
- 确认
requests.get().encoding是否和响应头一致;不一致就手动设r.encoding = 'gb2312' - 用
r.content.decode('gb2312')比r.text更可控 - 保存前打印几行数据,确认字符串本身已经是正常中文(而不是一堆
\u4f60\u597d或乱码字节)
BOM 只解决“如何让接收方正确解码”,不解决“源头数据是否已损坏”。
Python免费学习笔记(深入):立即使用
在学习笔记中,你将探索 Python 的核心概念和高级技巧!










