linux修改文件编码必须先用enca -l zh准确识别原始编码(file命令常误判gbk/gb18030为unknown-8bit),再用iconv -f 源编码 -t utf-8严格转换,-f写错会导致乱码或丢字,转换后需用file -i和hexdump验证utf-8有效性。

Linux 修改文本文件字符编码不是改个参数或后缀就能解决的事,关键在“先认准、再转对”——源编码识别错,转换结果必然乱码或丢字。
准确识别原始编码,别信 file 命令的直觉
file -i 文件名 常把 GBK/GB18030 文件误判为 charset=unknown-8bit 或 iso-8859-1,不可靠。真正适合中文文本的是 enca:
- 没装就先运行:sudo apt install enca(Ubuntu/Debian)或 sudo yum install enca(RHEL/CentOS)
- 必须加 -L zh(语言限定为中文),否则可能当成西欧编码误判:enca -L zh 文件名
- 输出如 “Chinese National Standard GB18030” 就是 GB18030,“Universal transformation format 8 bits” 表示 UTF-8
- 若报 Unrecognized encoding,大概率是混合编码或 BOM 异常,可手动试:iconv -f gbk -t utf-8 文件名 2>/dev/null | head -n 5
用 iconv 精确转换内容,-f 写错等于白干
iconv 不自动猜源编码,-f 必须和 enca 结果严格一致,否则轻则乱码,重则丢字:
- 标准写法:iconv -f GB18030 -t UTF-8 input.txt > output.txt
- 想看哪些字节被跳过,加 --verbose:iconv -f GBK -t UTF-8 --verbose input.txt > /dev/null 2>&1 | head -n 10
- 遇到 “Invalid or incomplete multibyte or wide character”,说明 -f 指定错误,不是加 -c 就能补救
- 转换后务必验证:file -i output.txt 应显示 charset=utf-8;再用 head -c 10 output.txt | hexdump -C 看是否有合法 UTF-8 字节(如 e6 88 91 表示“我”)
修复中文文件名乱码,iconv 完全不管用
Windows 传上来的文件名在 Linux 终端显示成 ???.txt,这是文件系统层编码错位,和文件内容无关:
- 正确工具是 convmv:convmv -f GBK -t UTF-8 --notest *.txt
- 默认只预览,确认无误再加 --notest 才真正执行
- 若提示 “No such file or directory”,说明当前 locale 缺少中文支持,先运行:locale -a | grep zh_CN.utf8,没输出就需生成 locale
- convmv 不支持递归,批量目录需配合 find:find ./dir -type f -name "*.log" -exec convmv -f GBK -t UTF-8 --notest {} \;
Vim 中临时查看或保存为新编码,别乱设 fileencoding
:set fileencoding 显示的是 Vim 当前“认为”的编码,并非文件真实编码,尤其对无 BOM 的 GBK 文件常误判:
- 想快速看懂内容,用命令模式输入::e ++enc=gbk % 或 :e ++enc=gb18030 % 强制重读
- 确认显示正常后,再设新编码并保存::set fileencoding=utf-8 → :wq
- 为避免每次手动试,可在 ~/.vimrc 加:set fileencodings=ucs-bom,utf-8,cp936











