java中string的length()返回utf-16代码单元数而非unicode字符数,含emoji或增补字符时易误判;应使用codepointcount获取真实字符数,按字节长度需用getbytes指定编码,安全截取需结合offsetbycodepoints与substring。

Java 中 String 的 length() 方法返回的是 UTF-16 代码单元(char)个数,不是人眼可见的“字符数”,尤其在含 emoji、生僻汉字或增补平面字符时容易误判。比如 "??" 看起来是一个人,但 length() 返回 4;"?"(U+20213)这类超 BMP 字符,length() 返回 2,实际只算 1 个 Unicode 字符。所谓“真实长度”,通常指 Unicode code point 数量,即用户感知的视觉字符数。
用 codePointCount 获取真实字符数
这是最直接的方式,统计字符串中 Unicode code point 的总数:
-
str.codePointCount(0, str.length())—— 返回真正的字符个数 - 适用于判断是否超出显示限制(如“最多 10 个字”)、做字符级计数等场景
- 注意:参数是
beginIndex和endIndex(按 char 索引),不是 code point 索引,所以必须传str.length()
按字节长度处理中文(如存储/传输限制)
中文在不同编码下占字节数不同:UTF-8 中常用汉字占 3 字节,GBK 中占 2 字节。若需按字节截断(如 HTTP header 限制、数据库字段字节上限),不能依赖 length():
- UTF-8 字节数:
str.getBytes(StandardCharsets.UTF_8).length - GBK 字节数:
str.getBytes(Charset.forName("GBK")).length - 避免用无参
getBytes(),它依赖系统默认编码,不可靠
安全截取前 N 个真实字符(不乱码)
直接 substring(0, 10) 可能在代理对中间切断,导致末尾出现 或运行时异常。正确做法是先定位第 N 个 code point 的 char 索引边界:
- 计算目标结束位置:
int end = str.offsetByCodePoints(0, Math.min(n, str.codePointCount(0, str.length()))); - 再截取:
str.substring(0, end) - 这个组合能保证截断点落在完整字符边界,不会拆开 emoji 或增补字符
兼容旧 JDK 的手动校验(JDK 7 及更早)
若项目无法升级 JDK,又需处理增补字符,可用 Character.isSurrogatePair() 配合遍历:
- 逐 char 扫描,遇到高代理(
isHighSurrogate(c))就跳过下一个低代理 - 每识别一个完整代理对,计数 +1;普通 BMP 字符也计数 +1
- 虽稍繁琐,但能避开
codePointCount等新 API 的兼容性问题
Java免费学习笔记:立即使用
解锁 Java 大师之旅:从入门到精通的终极指南











