半角转全角需手动构建映射表,因c++标准库无内置支持,且unicode不定义该语义;ascii字符(0x20–0x7e)对应u+ff01–u+ff5e等全角码位,偏移不统一,不可简单加减;utf-8字符串须按unicode码点解析,避免字节级误判。

半角转全角的映射规则必须手动定义
标准 C++ 库没有内置的半角→全角转换函数,std::locale 和 std::codecvt(已弃用)都不支持这种字符宽度变换。全角/半角本质是编码层面的视觉约定(主要在 Shift-JIS、GBK、UTF-8 中体现),不是 Unicode 标准语义,所以必须自己建映射表或调用平台 API。
常见错误是试图用 std::toupper 或宽字符转换(如 mbstowcs)来“放大”字符——这完全无效,它们不改变字形宽度。
- ASCII 半角字符(0x20–0x7E)对应全角范围通常是 U+FF01–U+FF5E(!-~)和 U+FF00( ,全角空格)
- 数字 0–9、字母 A–Z/a–z、标点符号需逐个映射,不能靠加减固定偏移量(例如
'A'→U+FF21,但'('→U+FF08,偏移量不统一) - 中文、日文汉字本身已是全角,无需转换;只处理 ASCII 区间字符
UTF-8 字符串中逐字节解析会出错
直接遍历 std::string 的 char 是危险的:UTF-8 中一个汉字占 3 字节,而半角 ASCII 字符占 1 字节。若按字节判断 c >= 0x20 && c ,可能把汉字中间字节误判为可转全角的 ASCII。
正确做法是先做 UTF-8 解码,识别出每个 Unicode 码点,再对码点值做判断和替换。
- 推荐用轻量库如
utf8cpp(头文件 only)的utf8::next()提取码点 - 或手写简单解码逻辑:检查首字节高位模式(
0xxxxxxx、110xxxxx、1110xxxx),跳过后续字节 - 切勿用
std::wstring_convert(C++17 已弃用)或 Windows 的MultibyteToWideChar(CP_UTF8)后再处理——绕路且易引入 BOM 或 surrogate pair 处理错误
最简可行实现(仅处理 ASCII + UTF-8 输入)
以下代码片段只依赖标准库,适用于纯 ASCII 符号 + 中文混合的 UTF-8 字符串(常见于日中双语环境):
#include <string>
#include <unordered_map><p>const std::unordered_map<char32_t char32_t> half_to_full = {
{0x0020, 0x3000}, // space → ideographic space
{0x0021, 0xFF01}, {0x0022, 0xFF02}, /<em> ... up to 0x007E → 0xFF5E </em>/
};</char32_t></p>
<p>std::string utf8_half_to_full(const std::string& s) {
std::string out;
for (size_t i = 0; i (s[i]));
if (it != half_to_full.end()) {
// append UTF-8 encoding of it->second
char32_t cp = it->second;
if (cp (cp);
else if (cp (0xC0 | (cp >> 6));
out += static_cast<char>(0x80 | (cp & 0x3F));
} else if (cp (0xE0 | (cp >> 12));
out += static_cast<char>(0x80 | ((cp >> 6) & 0x3F));
out += static_cast<char>(0x80 | (cp & 0x3F));
} else { /<em> 4-byte case </em>/ }
} else {
out += s[i];
}
++i;
} else {
// multi-byte UTF-8: copy as-is
unsigned char b = static_cast<unsigned char>(s[i]);
int len = (b & 0xF8) == 0xF0 ? 4 : (b & 0xF0) == 0xE0 ? 3 : (b & 0xE0) == 0xC0 ? 2 : 1;
out.append(s, i, len);
i += len;
}
}
return out;
}</unsigned></char></char></char></p></unordered_map></string>
注意:上面的 half_to_full 表需补全 95 个 ASCII 字符(0x20–0x7E),实际使用建议用生成脚本填充,避免手写漏项。
Windows 平台可用系统 API 替代
如果只跑 Windows,LCMapStringEx 配合 LCMAP_FULLWIDTH 可直接转换,但它依赖当前线程 locale,且对 UTF-8 输入需先转 wchar_t*,再转回 UTF-8:
- 输入必须是 valid UTF-16(用
MultiByteToWideChar(CP_UTF8, ...)) - 调用
LCMapStringEx(LANG_SYSTEM_DEFAULT, LCMAP_FULLWIDTH, ...) - 再用
WideCharToMultiByte(CP_UTF8, ...)输出 - 该 API 对中文标点(如「」『』)也生效,但对英文字母/数字行为与自定义表一致
- 跨平台项目慎用——Linux/macOS 无等价接口
真正麻烦的不是转换逻辑本身,而是确认你的字符串编码、目标显示环境(终端/字体是否支持全角渲染)、以及是否要保留原始排版语义(比如等宽字体里混用半角/全角会导致对齐错乱)。这些比写几行映射代码更值得花时间验证。
C++免费学习笔记(深入):立即使用
在学习笔记中,你将探索 C++ 的入门与实战技巧!











