最直接解法是显式指定encoding='gbk'参数:读取时用with open('data.txt', encoding='gbk') as f,写入时用with open('output.txt', 'w', encoding='gbk') as f;注意encoding必须小写,且gbk编码不支持emoji等超集字符,必要时加errors='ignore'兜底。

用 open() 指定 encoding='gbk' 最直接
Python 默认用 UTF-8 读写文件,直接打开 GBK 编码的文本会报 UnicodeDecodeError: 'utf-8' codec can't decode byte。解决办法就是显式告诉 open() 用 GBK 解码:
读取时:
with open('data.txt', encoding='gbk') as f:
content = f.read()
写入时(注意:文件不存在会自动创建,存在则覆盖):
with open('output.txt', 'w', encoding='gbk') as f:
f.write('你好,世界!')
关键点:
-
encoding参数必须小写,写成'GBK'或'Gbk'在某些系统上可能失败 - Windows 系统自带 GBK 支持,Linux/macOS 一般也内置,无需额外安装编码包
- 如果文件实际是 GB2312 或 GB18030 编码,
'gbk'通常也能兼容读取(GB18030 是超集),但写入一律按 GBK 字节输出
遇到乱码或解码失败?先确认真实编码
不是所有中文文本都是 GBK —— 有些是 gb2312,有些是 gb18030,还有可能是 utf-8-sig(带 BOM 的 UTF-8)。盲目指定 'gbk' 可能报错或显示乱码。
推荐做法:
- 用
chardet库快速探测:chardet.detect(open('file.txt', 'rb').read()),看返回的'encoding'字段 - 在终端用命令行验证:
file -i filename.txt(Linux/macOS)或用 VS Code 打开后看右下角编码标识 - 若探测结果是
'GB2312',可仍用'gbk'(兼容),但若明确是'GB18030',建议写成encoding='gb18030',避免个别生僻字出错
写入 GBK 文件时避免 UnicodeEncodeError
这个错误通常出现在字符串里混入了 GBK 不支持的字符(比如 emoji、某些 Unicode 4.0+ 新增汉字、全角符号等)。GBK 编码空间有限,只覆盖约 2 万汉字,远少于 Unicode。
常见触发场景:
- 从网页或现代编辑器复制含 emoji 的文本,再写入 GBK 文件
- 处理用户输入未过滤,直接落盘
- Python 中用
f.write(s)时,s含 U+3000 以外的全角标点(部分旧版 GBK 字库不全)
应对方式:
- 加
errors参数兜底:open('out.txt', 'w', encoding='gbk', errors='ignore')(丢弃非法字符)或errors='replace'(替换成?) - 更稳妥的做法是提前清洗:
s.encode('gbk', errors='ignore').decode('gbk'),相当于一次“GBK 安全过滤”
跨平台写 GBK 文件要注意换行符和 BOM
Windows 记事本默认用 CRLF(\r\n)且对无 BOM 的 GBK 文件识别更友好;Linux/macOS 习惯 LF(\n)。Python 的 open() 在 Windows 上默认用 \r\n,其他系统用 \n,一般不用干预。
但如果你希望文件在 Windows 记事本里 100% 正常显示(尤其含中文标题的配置文件),可以手动加 BOM:
with open('config.txt', 'w', encoding='utf-8-sig') as f: # ❌ 这是 UTF-8 BOM
f.write('标题:测试')
<h1>正确写法:GBK 不支持标准 BOM,但可用 \ufeff 做伪 BOM(部分软件识别)</h1><p>with open('config.txt', 'w', encoding='gbk') as f:
f.write('\ufeff标题:测试') # 注意:这不是标准做法,仅部分场景有效
</p>
实际上,绝大多数 GBK 场景不需要 BOM —— 强行加反而可能被其他程序误读。真正需要的是确保编码声明与内容一致,而不是靠 BOM“提示”。
最易被忽略的一点:用 pandas.read_csv(..., encoding='gbk') 时,如果文件有 BOM(哪怕 GBK 文件不该有),pandas 可能把它当 UTF-8 处理,导致首列名多出乱码字符。这时候得先用二进制模式读、切掉前两字节再解码。
Python免费学习笔记(深入):立即使用
在学习笔记中,你将探索 Python 的核心概念和高级技巧!











