javascript字符串默认utf-16存储,跨系统交互需按来源编码转目标编码;textencoder/textdecoder是utf-8处理标准方案;btoa/atob不支持中文,须配合textencoder使用;多字节编码检测与转换需encoding.js或iconv-lite;url编码应选encodeuricomponent或encodeuri。

JavaScript 字符串默认用 UTF-16 存储,但对接文件、后端 API、旧系统或浏览器 URL 时,常需转成 UTF-8、GBK、Shift_JIS、Base64 或百分号编码等格式。乱码、截断、报错,往往不是字符本身的问题,而是字节与字符串边界没理清。
明确来源编码再转目标编码是核心原则。不能假设“传进来就是 UTF-8”,也不能直接对中文调 btoa()——它只认 Latin-1 单字节。
用 TextEncoder / TextDecoder 处理 UTF-8 字节流
这是现代环境(Chrome/Firefox/Safari/Node.
js ≥11)的标准方案,轻量且无需额外依赖。
- 字符串 → UTF-8 字节数组:
new TextEncoder().encode("你好") 返回 Uint8Array,如 [228, 189, 160, 229, 165, 189]
- UTF-8 字节数组 → 字符串:
new TextDecoder("utf-8").decode(uint8Array) 自动处理 BOM 和非法字节;加 { fatal: false } 可跳过错误字节
- 注意:TextEncoder 只支持 UTF-8;要转 GBK、Big5、Shift_JIS 等,必须借助 encoding.js 或 iconv-lite
安全做 Base64 编解码(含中文、emoji)
btoa() 和
atob() 仅接受单字节字符串(Latin-1),直接传中文会报错。
- 编码(字符串 → Base64):
btoa(String.fromCharCode(...new TextEncoder().encode(str)))
- 解码(Base64 → 字符串):
new TextDecoder().decode(Uint8Array.from(atob(base64), c => c.charCodeAt(0)))
- 老环境兼容可用
encodeURIComponent + 正则替换,但不适用于二进制数据,性能也略低
识别并转换未知多字节编码(如 GBK、SJIS、EUC-JP)
读取本地文件、用户上传文本或接收旧系统响应时,原始编码常不确定,需检测 + 转换两步走。
- 用
encoding.js 的 Encoding.detect(bytes) 判断来源编码(支持 UTF-8 / GBK / SJIS / EUC-JP / ISO-2022-JP 等)
- 再用
Encoding.convert(bytes, { from: 'GBK', to: 'UTF8' }) 转为目标编码
- Node.js 中更常用
iconv-lite:iconv.decode(buffer, 'gbk') 直接得字符串,成熟稳定
URL 场景下的编码与解码
不同位置要用不同方法,混淆会导致参数解析失败。
-
encodeURIComponent():对整个值做 UTF-8 编码再百分号转义,适合 query 参数,如 "搜索=前端开发" → "%E6%90%9C%E7%B4%A2=%E5%89%8D%E7%AB%AF%E5%BC%80%E5%8F%91"
-
encodeURI():保留 / ? : @ & = + $ # 等 URI 结构字符,适合编码完整 URL
- 避免用已废弃的
escape()/unescape(),它们不遵循 URI 标准,且对 Unicode 处理不一致