java中char是utf-16编码的16位无符号整数,表示bmp内unicode码点;字符串编解码需显式指定charset,避免默认编码;处理代理对要用codepointcount或codepoints而非tochararray。

Java 中的 char 类型本身是 UTF-16 编码的 16 位无符号整数(取值范围 \u0000 到 \uffff),它不直接“存储编码”,而是表示一个 Unicode 码点(基本多文种平面 BMP 内)。真正涉及编码转换的是 char[] 或 String 与字节数组(byte[])之间的相互转换——这需要明确指定字符集(如 UTF-8、GBK、ISO-8859-1)。
char 和 String 本质是 Unicode,编码转换发生在 byte 层面
Java 运行时内部用 UTF-16 表示字符;但写入文件、网络传输或与外部系统交互时,需转为某种字节编码。关键不是对单个 char “转码”,而是对字符串整体做 String → byte[] 或 byte[] → String 的编解码操作。
-
str.getBytes(Charset):把字符串按指定编码转成字节数组 -
new String(bytes, Charset):用指定编码把字节数组解码为字符串 - 避免使用无参
getBytes()或String(byte[]),它们依赖平台默认编码,不可移植
处理超出 BMP 的字符(如 emoji、古汉字)要小心
Unicode 中部分字符(码点 ≥ 0x10000)在 UTF-16 中用两个 char(代理对,surrogate pair)表示。例如 ?(U+1F30D)在 Java 中占 2 个 char:
-
String s = "\uD83C\uDF0D";—— 正确构造代理对 -
s.codePointCount(0, s.length())返回 1(实际是一个 Unicode 字符) - 用
s.codePoints().forEach(...)遍历码点,而非for(char c : s.toCharArray())(会拆开代理对)
常见编码转换示例(推荐显式指定 Charset)
以下代码片段展示安全、可读的编码操作:
- UTF-8 转换:
byte[] utf8 = str.getBytes(StandardCharsets.UTF_8); String s = new String(utf8, StandardCharsets.UTF_8); - GBK 转换(中文环境常见):
byte[] gbk = str.getBytes(Charset.forName("GBK")); String s = new String(gbk, Charset.forName("GBK")); - 检测乱码?可对比不同编码解码结果,或用
CharsetDecoder设置onMalformedInput(CodingErrorAction.REPORT)主动捕获异常
不建议对 char 做“强制类型转换”来模拟编码
例如 (byte)myChar 或 (char)someByte 是危险操作:
- 会截断高位,丢失信息(
char是 16 位,byte是 8 位) - 未考虑字符集映射关系,无法正确表达汉字等非 ASCII 字符
- 仅适用于纯 ASCII(\u0000–\u007f)且目标编码也是单字节的情况(如 ISO-8859-1),但属于巧合,不应作为通用方案
Java免费学习笔记:立即使用
解锁 Java 大师之旅:从入门到精通的终极指南











