直接按字节数截断 utf-8 字符串会导致中文、emoji 等被劈开而乱码;正确做法是逐码点解析计算可视宽度(ascii 为 1 列、中文为 2 列),再按列宽截断与居中,同时需处理 tab、ansi 转义序列并支持自定义宽度映射。

用 std::string 手动切分换行时,别直接按字符数截断
中文、全角标点、emoji 或混合 UTF-8 编码下,std::string::size() 返回的是字节数而非可视宽度。直接用 substr(0, width) 切会把一个汉字(如 "中" 占 3 字节)从中间劈开,输出乱码或崩溃。
正确做法是先用 std::mbstowcs 或轻量 UTF-8 解码逻辑(如遍历字节判断前缀:0xC0–0xFF 开头为多字节起始)计算每个码点宽度,再累加可视列宽。常见中文字符宽为 2 列,ASCII 字符宽为 1 列,控制字符宽为 0。
- 推荐用现成小工具函数,比如
utf8_width(const std::string& s)返回总列宽,utf8_truncate(const std::string& s, size_t max_width)返回截断后合法字符串 - Windows 控制台默认不支持 UTF-8 宽度计算,需先调用
SetConsoleOutputCP(CP_UTF8)并确保终端字体支持 - 避免在循环中反复调用
mbstowcs转整个字符串——它内部有状态,且性能差;应逐码点解析
居中对齐不是简单左右补空格,要考虑换行后每行独立处理
“整段字符串居中”和“每行各自居中”效果完全不同。例如列宽 20,输入 "Hello\n世界",若整体居中会把两行拼成一行再居中;而实际需求是第一行 " Hello ",第二行 " 世界 "(注意“世界”占 4 列,两边各补 8 列空格)。
所以必须先完成换行切分,再对每一行单独做居中:
- 每行目标宽度 = 指定列宽
cols - 该行当前可视宽度 =
utf8_width(line) - 左补空格数 =
(cols - current_width) / 2(向下取整),右补 =cols - current_width - left_pad - 注意:空格本身是 ASCII 字符,宽度恒为 1,补多少个就占多少列
std::ostringstream + 自定义填充不适合复合排版,改用行缓冲构建
有人试图用 std::setw 和 std::setfill(' ') 配合 operator 实现居中,但这只对单行有效,且无法干预换行逻辑。一旦字符串含 <code>'\n',流操作会原样输出,不会重新计算每行宽度。
真正可控的方式是手动构造结果:
- 输入字符串 → 按语义分词或按列宽贪心切分(保留完整码点,不切断 UTF-8 序列)→ 得到
std::vector<:string></:string>行列表 - 对每行调用
center_line(line, cols),返回新字符串 - 用
std::string result累加,行间加"\n" - 避免用
+=频繁拼接长字符串,可预估容量:result.reserve(total_lines * (cols + 1))
遇到 Tab、ANSI 转义序列时,宽度计算必须跳过不可见字符
如果输入含 "\t" 或颜色控制码如 "\033[32mOK\033[0m",直接算 strlen 会把转义序列当普通字符,导致宽度虚高、居中错位甚至越界。
解决方案是预处理阶段过滤或标记不可见控制序列:
- 识别
"\t":替换成 4 或 8 个空格(取决于终端 tabstop),或按需映射为等效空格数 - 识别 ANSI 序列(形如
"\033[...m"):用正则或状态机跳过,仅累计可见字符宽度 - 更稳妥的做法是写一个
visible_width_and_clean(const std::string&),返回宽度 + 清洗后的纯文本(用于显示),同时保留原始串用于着色重放
宽度计算和换行逻辑最容易被忽略的,是“同一字符在不同环境宽度不同”——比如某些等宽字体里中文全角括号占 2 列,但某些终端渲染为 1 列。真要健壮,得允许用户传入自定义宽度映射表,而不是硬编码规则。
C++免费学习笔记(深入):立即使用
在学习笔记中,你将探索 C++ 的入门与实战技巧!











