必须先准确识别原始编码再用iconv精确转换;enca -l zh可可靠识别中文文件编码(如gb18030、utf-8),而file命令常误判;-f参数须与enca结果严格一致,否则导致乱码或丢字,转换后需用file -i和hexdump验证。

直接改文件编码不是“设个参数就完事”,核心在于:必须先准确识别原始编码,再用 iconv 精确转换;误判源编码会导致输出全乱或部分丢字。
用 enca -L zh 准确识别中文文件原始编码
file 命令对 GBK/GB18030 文件基本不可靠,常返回 charset=unknown-8bit 或误判为 iso-8859-1。
enca 是专为中文文本设计的识别工具,结果更可信:
- 未安装时:sudo apt install enca(Debian/Ubuntu)或 sudo yum install enca(RHEL/CentOS)
- 必须加 -L zh,否则可能把 GBK 误判为西欧编码
- 输出如 Chinese National Standard GB18030 就是 GB18030,Universal transformation format 8 bits 表示 UTF-8
- 若报 Unrecognized encoding,大概率是混合编码或 BOM 异常,别硬转,先用 iconv -f gbk -t utf-8 file.txt 2>/dev/null | head -n 5 手动试
iconv -f 源编码 -t UTF-8 转换内容,-f 写错就白干
iconv 不自动猜源编码,-f 必须和 enca 结果严格一致:
- 常见组合:iconv -f GB18030 -t UTF-8 input.txt -o output.txt、iconv -f GBK -t UTF-8 input.txt > output.txt
- 加 --verbose 可看到哪些字节被跳过:iconv -f GBK -t UTF-8 --verbose input.txt > /dev/null 2>&1 | head -n 10
- 遇到 Invalid or incomplete multibyte or wide character 错误,说明 -f 指定错误,不是加 //IGNORE 就能解决
- 转换后务必验证:file -i output.txt 应显示 charset=utf-8,再用 head -c 5 output.txt | hexdump -C 看是否含合法 UTF-8 字节序列(如 e6 88 91)
convmv -f gbk -t utf-8 -r 修复中文文件名乱码,和 iconv 完全无关
Windows 传上来的中文文件名在 Linux 终端显示成 ???.txt,这是文件系统层的编码错位:
- iconv 对文件名完全无效,强行用它只会浪费时间
- 正确工具是 convmv:convmv -f gbk -t utf-8 -r /path/to/dir
- 默认只预览不执行,确认无误后加 --notest 才真正改名
- 若提示 Can't convert encoding: No such file or directory,说明当前 locale 缺少中文支持,先运行 locale -a | grep zh_CN.utf8,没输出就需生成 locale
Vim 中临时查看乱码文件,别一上来就 :set fileencoding=utf-8
想快速看懂一个文件,又不想动原内容:
- :set fileencoding? 显示的是 Vim 当前“认为”的编码,不是文件原始编码,常被 fileencodings 自动猜错
- 正确做法是::e ++enc=gbk、:e ++enc=utf-8、:e ++enc=latin1 逐个试,看哪次文字正常
- 确认后如需保存为 UTF-8::set fileencoding=utf-8 → :wq,但前提是已确认原始编码可安全重读
文件名和文件内容的编码是两层事,工具不能混用;enca 和 iconv 都依赖 locale 支持,zh_CN.UTF-8 缺失时连 enca -L zh 都可能失效——这点最容易被忽略。











