std::wstring_convert和std::codecvt_utf8自C++17起已被弃用,C++20中移除;推荐替代方案为平台API(Windows用MultiByteToWideChar/WideCharToMultiByte)或轻量第三方库(如utf8cpp)。

std::wstring_convert<:codecvt_utf8>> 已被弃用,别再用了
从 C++17 开始,std::wstring_convert 和 std::codecvt_utf8 全部被标记为 deprecated,主流编译器(GCC、Clang、MSVC)在 C++17 模式下会报错或警告。强行启用会导致链接失败(如 undefined reference to std::codecvt_utf8<char32_t>::do_out</char32_t>),尤其在跨平台构建时极易翻车。
根本原因:C++ 标准委员会认为 locale-based 编码转换接口设计僵硬、线程不安全、且无法处理 surrogate pair 等边界情况,已移出标准库。
替代方案只有两个务实选择:
- 用平台 API:Windows 用
MultiByteToWideChar(注意它返回的是 UTF-16,不是 UTF-32);Linux/macOS 用iconv()或std::mbrtoc32 - 用轻量第三方库:推荐 stb_utf8.h 或更现代的 utf8cpp(后者支持 UTF-32 转换)
用 std::mbrtoc32 实现 UTF-8 → UTF-32(POSIX/Linux/macOS)
std::mbrtoc32 是 C11 引入、C++11 起可用的标准函数,能安全地将多字节 UTF-8 序列逐步解码为 char32_t。但它不接受 std::string 直接输入,需手动管理状态和缓冲区。
关键注意事项:
- 必须传入
mbstate_t对象(不能是临时变量),用于跟踪多字节序列状态(比如遇到截断的 UTF-8 字节) - 输入指针必须指向
const char*,且每次调用后需手动推进指针位置 - 返回值为 -3 表示不完整字符(需更多输入),-2 表示非法字节,0 表示空字符,>0 表示已消费字节数
- 它不验证 UTF-8 是否规范(例如过长编码、高位无效),需额外检查
char32_t值是否在 U+0000–U+10FFFF 且非代理区(U+D800–U+DFFF)
简短示例(无错误处理):
std::vector<char32_t> utf8_to_utf32(const std::string& s) {
std::vector<char32_t> out;
mbstate_t ps = {};
const char* ptr = s.c_str();
const char* end = ptr + s.size();
<pre class="brush:php;toolbar:false;">while (ptr (-1) || n == static_cast<size_t>(-2)) {
// 非法 UTF-8,按需处理(如跳过或替换为 U+FFFD)
ptr++;
continue;
}
if (n > 0) {
out.push_back(c32);
ptr += n;
}
}
return out;</size_t>
}
Windows 上如何得到真正的 UTF-32(而非 UTF-16)
Windows API 的 MultiByteToWideChar(CP_UTF8, ..., LPCWSTR) 返回的是 UTF-16,不是 UTF-32 —— 即使你用 char32_t* 接收,也只是把两个 wchar_t 当作一个 char32_t 解释,对 BMP 外字符(如 emoji)会出错(比如 U+1F600 ? 变成两个独立 code unit,而非单个 0x1F600)。
正确做法只有两种:
- 先用
MultiByteToWideChar转成 UTF-16std::wstring,再手动做 UTF-16 → UTF-32 代理对解码(检测0xD800–0xDFFF区间并合成) - 改用跨平台库(如 utf8cpp),它内部已封装该逻辑,且 Windows 下不依赖系统 API
不推荐自己手写代理对解码:容易漏掉边界条件(如孤立高代理、低代理在前等),且 std::wstring 在 Windows 下是 UTF-16,在 Linux/macOS 下是 UTF-32,混用极易引发未定义行为。
为什么 utf8cpp 是最省心的选择
utf8cpp 的 utf8::utf8to32 函数直接接受 std::string::iterator,自动处理所有 UTF-8 解码细节,并抛出 utf8::exception 供捕获非法序列。它不依赖 locale、不调用系统 API、头文件仅一个,编译零开销。
典型用法:
#include "utf8.h" std::string utf8_str = u8"Hello 世界 ?"; std::vector<char32_t> utf32; utf8::utf8to32(utf8_str.begin(), utf8_str.end(), std::back_inserter(utf32));</char32_t>
它还会自动过滤掉无效编码(如 U+FFFE)、拒绝超范围码点(>U+10FFFF),比手写 mbrtoc32 更健壮。唯一要注意的是:确保传入的是合法 UTF-8 —— 它不做原始字节校验,若输入是 GBK 或乱码,结果仍是未定义的。
真正麻烦的从来不是“怎么转”,而是“谁来保证输入是 UTF-8”以及“非法字节要不要静默丢弃”。这些决策点,标准库故意没管,得你自己兜底。
C++免费学习笔记(深入):立即使用
在学习笔记中,你将探索 C++ 的入门与实战技巧!











