全角标点的unicode范围包括u+3000–u+303f、u+3099–u+309c、u+30a0、u+30fb、u+ff01–u+ff5e、u+ffe0–u+ffe6等区间,需先将utf-8字符串解码为char32_t码点再逐个判断。

全角标点的 Unicode 范围怎么判断
全角标点不是靠“宽度”识别的,而是落在特定 Unicode 区段:最常见的是 U+FF01–U+FF5E(全角 ASCII 对应区,如!"#$%…),加上 U+3000–U+303F(中文标点、顿号、书名号、句号等),以及 U+3099–U+309C、U+30A0、U+30FB 等零散字符。C++ 标准库不提供“是否为全角标点”的内置判定,必须手动检查码点。
关键点是:std::string 存的是字节,而全角字符在 UTF-8 下占 3 字节,不能用 char 遍历;必须先转成 std::u32string 或逐 UTF-8 解码。
用 std::u32string + 手动范围过滤最稳妥
把原始 UTF-8 字符串解码为 std::u32string,再对每个 char32_t 判断是否落在全角标点区间,保留非标点字符。这是最清晰、无编码歧义的做法。
实操建议:
- 用
std::wstring_convert<:codecvt_utf8>, char32_t></:codecvt_utf8>(C++11/14)或 C++20 的std::from_chars+ 第三方 UTF-8 解码(如 utf8cpp)转码;更推荐直接用utf8cpp库避免过时 API - 判断逻辑用多个区间检查,别写成大段
if (c == 0x3002 || c == 0xFF01 || ...)——易漏且难维护 - 常见全角标点区间包括:
0x3000–0x303F、0x3099–0x309C、0x30A0、0x30FB、0xFF01–0xFF5E、0xFFE0–0xFFE6
示例片段(依赖 utf8cpp):
#include <utf8.h>
#include <string>
#include <vector>
std::string remove_fullwidth_punct(const std::string& s) {
std::u32string u32;
utf8::utf8to32(s.begin(), s.end(), std::back_inserter(u32));
std::u32string filtered;
for (char32_t c : u32) {
if (!((c >= 0x3000 && c = 0x3099 && c = 0xFF01 && c = 0xFFE0 && c
<h3>为什么不能用 iswpunct() 或 locale</h3>
<p><code>std::iswpunct</code> 依赖当前 locale,而多数系统 locale(如 <code>"C"</code> 或 <code>"en_US.UTF-8"</code>)只识别 ASCII 标点,对 U+3002(。)、U+FF01(!)等返回 <code>false</code>,结果就是全角标点全被放过。</p>
<p>即使设成 <code>setlocale(LC_CTYPE, "zh_CN.UTF-8")</code>,行为也不可靠:glibc 对全角标点的 <code>iswpunct</code> 支持不一致,macOS 和 Windows 更弱。这不是 bug,是标准没规定全角字符必须被识别为标点。</p>
<p>所以:别指望标准宽字符分类函数,自己控范围才是唯一可移植方案。</p>
<h3>性能和边界情况要注意什么</h3>
<p>UTF-8 解码本身有开销,但对普通文本(
</p>
<ul>
<li>输入含非法 UTF-8 字节序列(如截断的 3 字节字符)——<code>utf8cpp</code> 默认抛异常,需用 <code>utf8::invalid_utf8</code> 捕获或改用容错解码</li>
<li>全角空格(U+3000)常被当成“空白”忽略,但它属于全角标点区,要删就得明确包含在过滤范围内</li>
<li>全角数字/字母(如 A、1)不属于标点,上述区间判断不会误删——这点正是手动范围的优势</li>
</ul>
<p>如果字符串确定只含 GBK 或 Big5 编码,就不能用 UTF-8 解码路径,得先转 UTF-8 再处理;否则所有判断都失效。</p></vector></string></utf8.h>C++免费学习笔记(深入):立即使用
在学习笔记中,你将探索 C++ 的入门与实战技巧!











