char是编码载体而非语义字符:java/c#中为utf-16 code unit(bmp字符占1个,辅助平面需代理对),c/c++中char为1字节且无编码绑定,宽字符才用于unicode;正确处理需用码点或字形簇api。

字符型 char 在内存中并不直接“存储 Unicode 编码”,而是以特定编码格式(如 UTF-16 或 UTF-8)的字节序列形式存放,具体实现取决于编程语言和运行环境。
Java 中 char 存储的是 UTF-16 code unit
Java 的 char 类型占 16 位(2 字节),其设计初衷是表示一个 UTF-16 code unit。这意味着:
- 对于 Unicode 基本多文种平面(BMP,U+0000 到 U+FFFF)内的字符(如英文字母、汉字大部分),
char可直接表示,值等于该字符的码点(code point); - 对于超出 BMP 的字符(如某些 emoji、古文字,码点 ≥ U+10000),Java 使用一对
char(即 surrogate pair)来表示:一个 high surrogate(U+D800–U+DBFF)加一个 low surrogate(U+DC00–U+DFFF); - 单个
char变量无法完整表示一个非 BMP 字符,必须用String.codePointAt()或Character.toCodePoint()等 API 正确处理。
C/C++ 中 char 与 Unicode 无直接绑定
C 和 C++ 标准中的 char 是 1 字节整型,语义上仅保证能表示基本执行字符集(通常是 ASCII)。它本身不携带编码信息:
- 若源文件保存为 UTF-8,字符串字面量中的中文会以多个
char(如 3 字节)连续存储,每个char存一个 UTF-8 编码字节; - 宽字符类型
wchar_t才用于 Unicode,但其大小和编码(UTF-16 或 UTF-32)由平台决定(Windows 常为 UTF-16,Linux 多为 UTF-32); - 要安全操作 Unicode 文本,需配合
mbstowcs、u8string(C++20)等工具,并明确指定编码上下文。
.NET(C#)中 char 对应 UTF-16 code unit
C# 的 char 同样是 16 位,语义与 Java 一致:
- 每个
char是一个 UTF-16 code unit; -
string内部是char数组,因此也采用 UTF-16 编码; - 获取真实 Unicode 码点需用
char.ConvertToUtf32()或string.EnumerateRunes()(.NET 5+); - 直接用
str.Length得到的是 code unit 个数,不是字符(grapheme cluster)数量,例如 ?(U+1F30D)占 2 个char。
关键提醒:char ≠ 字符(character)
这是最容易混淆的一点:
-
char是最小可寻址的存储单元,不是逻辑上的“字符”; - Unicode 中的“字符”可能对应 1 个(BMP)、2 个(surrogate pair)甚至多个 code unit(如带组合符的 é = U+0065 + U+0301);
- 真正面向用户的文本处理(如光标移动、计数、截断)应基于 grapheme clusters,而非
char或 code unit。
不复杂但容易忽略:理解 char 的本质是编码载体,而非语义字符,是正确处理国际化文本的基础。










