std::string::substr 按字节切分 utf-8 字符串会截断中文导致乱码,因一个汉字占 3 字节;必须按 unicode 码点或显示宽度(中文通常为 2,ascii 为 1)处理,推荐用 utf8::next 逐字符解析并累加宽度。

字符串按固定宽度换行时,为什么 std::string::substr 容易截断 UTF-8 中文?
直接用 substr 按字节切分,遇到中文会乱码——因为 UTF-8 下一个汉字占 3 字节,substr(0, 20) 可能卡在某个汉字中间。必须按 Unicode 码点或显示宽度(而非字节数)计算。
- 推荐用
std::mbrtowc或第三方库(如 ICU、utf8cpp)解析 UTF-8 字符边界 - 简单场景可用
utf8::next(来自utf8.h)逐字符前进,累加显示宽度(中文算 2,ASCII 算 1) - 避免依赖 locale 的
std::codecvt_utf8(C++17 起已弃用)
如何用 std::stringstream + 手动扫描实现带缩进的换行?
不用外部库时,最可控的方式是自己遍历字符串,维护当前行宽,遇到空格或标点主动断行,并在后续行前插入缩进字符串。
- 输入参数:原始字符串
text、每行最大显示宽度width、缩进字符串indent(如" ") - 关键逻辑:从头开始扫描,对每个字符调用
utf8::width(c)获取显示宽度;累计超width且前一个位置是空白时回退断行 - 若当前行为空但待处理字符本身宽度就超限,强制从该字符开始新行(避免死循环)
- 第二行起,先写
indent,再写内容
std::vector<:string> wrap(const std::string& text, int width, const std::string& indent) {
std::vector<:string> lines;
std::string line;
int current_width = 0;
size_t i = 0;
while (i = 0x3000 && cp width && !line.empty()) {
lines.push_back(line);
line.clear();
current_width = 0;
i -= char_len; // 回退,让下轮重处理这个字符
} else {
line += text.substr(i, char_len);
current_width += w;
}
i += char_len;
}
if (!line.empty()) lines.push_back(line);
// 插入缩进(除首行外)
for (size_t j = 1; j <h3>
<code>std::regex</code> 能不能用来做自动换行?</h3>
<p>不能可靠用于此场景。正则表达式匹配的是字节模式,无法感知 UTF-8 多字节结构,也无法动态计算字符显示宽度。即使写成 <code>R"((.{1,50})(?:\s+|$))"</code>,也会在中文中间硬切,且无法处理全角空格、不间断空格等。</p><div class="aritcle_card flexRow artxards">
<div class="artcardd flexRow">
<a class="aritcle_card_img" rel="nofollow" href="/xiazai/skill2659" title="C++"><img
src="https://img.php.cn/upload/skill/000/000/081/178927213426672.jpg" alt="C++" onerror="this.onerror='';this.src='/static/lhimages/moren/morentu.png'" ></a>
<div class="aritcle_card_info flexColumn">
<a rel="nofollow" href="/xiazai/skill2659" title="C++" class="overflowclass">C++</a>
<p class="overflowclass">"空空如也"</p>
</div>
<a rel="nofollow" href="/xiazai/skill2659" title="C++" class="aritcle_card_btn flexRow flexcenter"><b></b><span>下载</span>
</a>
</div>
</div>
<ul>
<li>
<code>std::regex</code> 在 C++11 中对 UTF-8 支持极弱,<code>std::wregex</code> 需要先转 <code>std::wstring</code>,而 Windows 和 Linux 的 wchar_t 编码不一致(UTF-16 vs UTF-32)</li>
<li>即便能匹配,也无法返回“断在哪个字节偏移”,更无法控制缩进插入位置</li>
<li>仅适合 ASCII 纯英文、且宽度单位为字节的简单日志截断</li>
</ul>
<h3>性能和跨平台兼容性要注意什么?</h3>
<p>高频调用(如 UI 文本渲染)时,反复构造 <code>std::string</code> 和多次 <code>substr</code> 开销明显;Windows 控制台默认不支持 UTF-8,<code>SetConsoleOutputCP(CP_UTF8)</code> 必须显式调用。</p>
<ul>
<li>预分配输出 <code>std::vector</code> 容量(例如 <code>lines.reserve((text.length() + width - 1) / width)</code>)</li>
<li>避免在循环中重复调用 <code>text.length()</code>,改用 <code>size_t end = text.length()</code>
</li>
<li>Linux/macOS 下终端宽度可用 <code>ioctl(TIOCGWINSZ)</code> 获取,但 Windows 需 <code>GetConsoleScreenBufferInfo</code>,二者 API 完全不同</li>
<li>缩进字符串建议传 <code>std::string_view</code>(C++17),避免无谓拷贝</li>
</ul>
<p>实际用的时候,最麻烦的不是算法逻辑,而是确认“宽度”到底指什么:是终端列数、GUI 控件像素宽度,还是字体度量下的 em 宽度。一旦混用,换行位置就会偏移。别假设所有环境都把中文当两个 ASCII 宽——有些等宽字体里中文和英文一样宽,有些则不然。</p></:string></:string>C++免费学习笔记(深入):立即使用
在学习笔记中,你将探索 C++ 的入门与实战技巧!










