python读取txt必须显式指定encoding='utf-8',否则默认系统编码(如windows的cp936)会导致unicodedecodeerror;html文件头须含,且命令行处理前需用tr或dos2unix清理\r。

Python读取TXT时encoding参数必须显式指定为utf-8
不加encoding='utf-8',Python默认用系统编码(Windows上常是cp936),中文直接报UnicodeDecodeError。哪怕文件看着能打开,输出HTML里也可能出现或乱码。
- 用
open('input.txt', 'r', encoding='utf-8')是底线,别信“我试过不写也能跑”——那是文件恰好用系统编码保存的偶然 - 如果不确定源文件编码,先用
chardet库探测:chardet.detect(open('input.txt','rb').read()),再按实际结果传encoding - 写入HTML时同样要写
encoding='utf-8',否则浏览器读不到BOM或meta声明时仍可能误判
HTML文件头必须包含<meta charset="utf-8">
只靠Python读写设UTF-8不够。浏览器打开.html文件时,不看Python怎么读的,只看HTML里有没有明确的字符集声明。缺这行,即使内容全是UTF-8字节,Chrome/Firefox也可能回退到ISO-8859-1解析。
- 模板里漏掉这行:
<meta charset="utf-8">,中文就大概率显示为方块或问号 - 不要写
<meta http-equiv="Content-Type" content="text/html; charset=utf-8">——老写法兼容性差,现代标准只认charset属性 - 这行必须放在
内、且越靠前越好,最好紧跟<title></title>之后
sed/awk命令行转换时需先清理\r再处理编码
Linux/macOS下用sed转TXT,遇到Windows换行符\r\n会把\r当普通字符塞进HTML标签里,导致段落末尾多出空白或换行错位。
- 先运行
tr -d '\r' clean.txt或dos2unix input.txt - 再用
sed '1s/^//; $s/$//; s/^$//; /^$/!s/^/<p>/; /^$/!s/$//' clean.txt > output.html</p> - 如果原始TXT是GBK编码(比如老版记事本保存),不能直接管道进sed——得先转码:
iconv -f GBK -t UTF-8 input.txt | tr -d '\r' | sed ...
Pandoc转换必须配--charset=utf-8且禁用默认模板
很多人用pandoc input.txt -o output.html发现中文变乱码,其实不是Pandoc问题,而是它默认按UTF-8读,但没在输出HTML里写meta声明,且用了带CSS的完整模板,干扰了编码识别。
- 强制输出UTF-8声明:
pandoc --charset=utf-8 --standalone=false input.txt -o output.html -
--standalone=false禁用全页模板,只输出内容,方便你手动套壳——否则生成的HTML里meta位置不可控 - 若源文件非UTF-8,必须前置转码:
iconv -f GBK -t UTF-8 input.txt | pandoc --charset=utf-8 --standalone=false -o output.html
meta声明**和**命令行中对\r的清理**——这两处不处理,前面所有编码设置都白搭。前端入门到VUE实战笔记:立即使用
在学习笔记中,你将探索 前端 的入门与实战技巧!











