char是8位整数类型,非16位;符号性由实现定义,可能为signed或unsigned;仅存储字节值,无内置字符语义;处理多语言应使用char8_t/u16string等明确编码类型。

这个说法是错误的。
char 是 1 字节,不是 16 位
在 C++ 标准中,sizeof(char) 恒为 1,且 1 字节定义为恰好 8 位(即 CHAR_BIT == 8)。因此 char 永远是 8 位宽,不可能是 16 位。
常见误解来源:
- 把 Java 的
char(16 位 Unicode)混淆进 C++; - 误将
wchar_t(Windows 上常为 16 位,Linux/macOS 上常为 32 位)当作char; - 看到
char16_t就以为是char的“升级版”——其实它是完全独立的新类型,和char无继承或兼容关系。
char 是整数类型,但符号性不固定
char 本质是带实现定义符号性的 8 位整数:
- 它可等价于
signed char或unsigned char,取决于编译器(GCC/Clang 默认有符号,某些嵌入式环境默认无符号); - 它不是“无符号”的——不加修饰的
char不能假设为unsigned; - 它的取值范围可能是 −128~127,也可能是 0~255;做位运算、范围判断或传给
std::isdigit等函数时,必须小心处理符号问题。
char 不存储“字符”,只存储字节值
char 本身没有字符语义:
-
'a'在内存中就是整数 97;'€'在窄字符环境下无法正确表示,可能被截断或触发多字节编码歧义; - 中文、emoji、带重音字母(如
é)均超出单字节表达能力,需用char8_t+ UTF-8、char16_t+ UTF-16 或char32_t+ UTF-32 配合相应字符串类型(如std::u16string); - 所谓“字符数组是字符串”,前提是末尾有
'\0';否则只是普通字节序列,printf("%s", arr)会越界读取直到偶然遇到零字节。
别用 char 处理多语言文本
如果目标是可靠支持中文、日文、阿拉伯文等:
- 避免裸
char*和std::string(它们只是字节容器,不感知编码); - 优先使用明确编码意图的类型:如
std::u8string(C++20)、std::u16string、std::u32string; - 跨平台项目中,
wchar_t因平台差异大(Windows=16bit,Linux=32bit),已不推荐作为通用 Unicode 解决方案。











