全角转半角的底层逻辑是按unicode码位范围减去固定偏移量0xfee0,需手动识别全角空格(u+3000)及u+ff01–u+ff5e、u+ff10–u+ff19、u+ff21–u+ff3a、u+ff41–u+ff5a等范围并映射,c++标准库无内置支持。

全角字符转半角的底层逻辑是什么
全角字符(如中文标点、全角英文字母)本质是 Unicode 中特定码位,和半角字符不是简单的一一映射关系。C++ 标准库不提供直接转换函数,必须手动判断字符范围并做码值偏移。常见误区是试图用 std::tolower 或宽字符流自动处理——它们对全角字符无效,甚至可能触发未定义行为。
关键识别点:ASCII 码 0x20–0x7E 是半角可打印字符;对应全角范围通常是 U+FF01–U+FF5E(全角 ASCII 符号)、U+FF00(全角空格)、U+FF10–U+FF19(全角数字)、U+FF21–U+FF3A / U+FF41–U+FF5A(全角大小写字母)。转换就是将这些码位减去固定偏移量(如 0xFEE0)。
用 std::wstring 处理 UTF-16 编码字符串时怎么写转换函数
Windows 默认宽字符是 UTF-16,std::wstring 可直接操作每个 wchar_t。但注意:UTF-16 中的代理对(surrogate pair)不能被当作单个 wchar_t 处理,而全角字符都在 BMP 平面(U+0000–U+FFFF),所以实际中基本无需拆分代理对。
以下函数只处理 BMP 内全角字符,安全且轻量:
std::wstring fullwidth_to_halfwidth(const std::wstring& s) {
std::wstring result = s;
for (wchar_t& c : result) {
if (c == L' ') { // 全角空格 U+3000
c = L' ';
} else if (c >= L'!' && c = L'0' && c = L'A' && c = L'a' && c
- 顺序很重要:先判全角空格(U+3000),再判其他范围,避免被后续条件覆盖
- 不要用
std::iswlower等宽字符分类函数——它们依赖 locale,对全角字符返回 false,无法用于识别 - 该函数不修改非全角字符(如汉字、日文假名),符合预期
Linux/macOS 下用 std::u32string 处理 UTF-32 更可靠吗
是的。UTF-32 每个 char32_t 对应一个 Unicode 码点,无代理对歧义,逻辑更清晰。但代价是内存翻倍,且 C++ 标准对 std::u32string 的 I/O 支持弱(比如 std::wcout 不直接支持)。
若你已用 std::u32string 存储文本,转换可简化为单范围判断:
std::u32string fullwidth_to_halfwidth(const std::u32string& s) {
std::u32string result = s;
for (char32_t& c : result) {
if (c == U' ') {
c = U' ';
} else if (c >= U'!' && c = U'0' && c = U'A' && c = U'a' && c
-
U''字符字面量确保编译期解析为char32_t,比L''更明确 - Linux 下需确保源文件保存为 UTF-8,且编译器支持(GCC/Clang ≥ 7,默认启用)
- 别忘了链接时指定 locale(如
setlocale(LC_ALL, "en_US.UTF-8")),否则某些系统函数可能误判
从 UTF-8 字符串转换时最容易踩哪些坑
UTF-8 是变长编码,直接按 char 遍历会把多字节字符拆开,导致乱码或崩溃。必须先解码为码点(char32_t),转换后再重新编码。
推荐做法:用标准库外的轻量解码(如手动解析,或用 std::mbrtoc32),而非引入 ICU。例如:
// 简化版 UTF-8 解码(仅处理 BMP)
std::vector<char32_t> utf8_to_codepoints(std::string_view s) {
std::vector<char32_t> out;
for (size_t i = 0; i
<ul>
<li>别用 <code>std::codecvt_utf8<char32_t></char32_t></code>:C++17 起已弃用,且各编译器实现不一致</li>
<li>全角字符在 UTF-8 中占 3 字节(如 U+FF01 → <code>\xEF\xBC\x81</code>),逐字节操作必然出错</li>
<li>转换后重新编码为 UTF-8 时,要检查码点是否超出 BMP(本场景不会,但通用函数需考虑)</li>
</ul>
<p>真正麻烦的是混合文本:一段里既有中文、又有全角标点、还有半角英文。这种情况下,靠简单范围匹配足够,但千万别指望正则或 locale-based 函数能自动识别“全角上下文”。</p></char32_t></char32_t>C++免费学习笔记(深入):立即使用
在学习笔记中,你将探索 C++ 的入门与实战技巧!











