javascript字符串unicode处理核心是区分utf-16编码单元与unicode码点,.length返回编码单元数而非字符数,需用array.from(str).length计数,codepointat()和fromcodepoint()处理辅助平面字符,正则须加u标志并用\p{emoji}等unicode属性类。

JavaScript 字符串的 Unicode 处理核心在于区分「UTF-16 编码单元」和「Unicode 码点」。底层用 UTF-16 存储,但操作时若混淆二者,就会导致长度误算、截断乱码、正则失灵等实际问题。
字符串长度与字符计数
`.length` 返回的是 UTF-16 编码单元数量,不是真实字符数。BMP 字符(如普通汉字、英文字母)占 1 单元,而 emoji(如 ?)、古汉字(如 ?)、ZWJ 组合序列(如 ???)都属于辅助平面,需用代理对表示,占 2 单元甚至更多。
- ✅ 正确获取字符数:
Array.from(str).length或[...str].length - ✅ 安全遍历单个字符:
for (const ch of str)—— 自动跳过代理对第二单元 - ❌ 避免:
str[i]、charAt(i)、传统for循环配合i++,会把代理对拆开
码点读取与生成
旧 API 如 charCodeAt() 和 fromCharCode() 只处理单个编码单元,无法正确表达辅助平面字符。
- ✅ 获取完整码点:
str.codePointAt(i)—— 返回位置 i 开始的 Unicode 码点(十进制),自动识别代理对 - ✅ 生成任意字符:
String.fromCodePoint(0x1F600, 0x4F60, 0x597D)→'?你好' - ❌ 不要用
String.fromCharCode(0x1F600),它只支持 ≤ 65535 的值,超出部分会被截断或转成
正则匹配与 Unicode 属性
默认正则引擎按 UTF-16 单元解析,/./ 匹配不了 emoji,/\w+/ 也匹配不到中文或带音标字母。
- ✅ 必须加
u标志:/./u.test('?')→true - ✅ 使用 Unicode 属性类:
/^\p{Emoji}$/u、/[\p{Script=Han}]/gu(匹配所有汉字) - ✅ 中文范围简写可用:
/[\u4e00-\u9fa5]/u,但注意末尾必须有u
多语言安全操作
截取、替换、大小写转换、排序等常见操作,在多语言场景下都有隐性陷阱。
- ✅ 截取前 n 个真实字符:
Array.from(str).slice(0, n).join('') - ✅ 本地化大小写:
'İ'.toLocaleLowerCase('tr-TR')(土耳其语)、'你好'.toLocaleUpperCase('zh-CN') - ✅ 本地化排序:
arr.sort((a, b) => a.localeCompare(b, 'zh-Hans'))(中文拼音序) - ✅ 数字感知排序:
a.localeCompare(b, 'en', { numeric: true })('item2' 排在 'item10' 前)
Java免费学习笔记:立即使用
解锁 Java 大师之旅:从入门到精通的终极指南











