中文标点unicode分布不连续,[\x{ff01}-\x{ff5e}]仅覆盖u+ff01–u+ff5e(!~),漏掉句号。u+3002、顿号、u+3001等常用标点需手动补充。

匹配中文标点时,为什么[\x{ff01}-\x{ff5e}]会漏掉句号和顿号
因为全角标点的 Unicode 范围不是连续的。\x{ff01}-\x{ff5e}只覆盖了 U+FF01 到 U+FF5E(即!到~),但中文句号。是 U+3002、顿号、是 U+3001、书名号《》是 U+300A/U+300B,它们不在这个区间里。硬套这个范围,会漏掉大量常用中文标点。
- 真正要覆盖常见中文标点,得手动补上:
[\x{3000}\x{3001}\x{3002}\x{3008}-\x{300f}\x{3010}-\x{3011}\x{3014}-\x{3015}\x{3016}-\x{3017}\x{3018}-\x{3019}\x{301a}-\x{301b}\x{ff01}-\x{ff5e}] - 其中
\x{3000}是全角空格,必须单独加,它不在ff01-ff5e里 - 半角标点如
,.!?;:直接写进字符类即可,不用 Unicode 表示,更清晰
preg_match('/[^\x{4e00}-\x{9fa5}a-zA-Z0-9]/u', $str) 为什么常被误用
这个表达式本意是“匹配非中文、非英文、非数字的字符”,但它会把所有中文标点(如。?!)都当成目标——而你往往只想提取或替换标点,不是剔除它们。更糟的是,它还会匹配制表符、换行符、零宽字符等,导致行为不可控。
- 如果目标是“找出所有中英文标点”,应显式枚举:
/[\x{3001}\x{3002}\x{ff0c}\x{ff1f}\x{ff01}\x{ff1b}\x{ff1a},.!?;:]/u - 如果目标是“过滤掉标点只留文字”,才用否定式,但建议加
[:punct:]辅助:/[^\x{4e00}-\x{9fa5}a-zA-Z0-9[:punct:]\s]/u,再单独处理标点逻辑 - 别依赖
\w匹配中文——PHP 的\w默认只认 ASCII 字母数字下划线,哪怕加u修正符也不扩展中文
同时匹配全角和半角标点,正则怎么写才不踩坑
最稳妥的方式是分开写、合并用,而不是靠模糊范围。比如想把“,”和“,”都匹配出来,直接列出来比试图找“映射关系”更可靠。
- 推荐写法:
/[,。!?;:""''()【】《》、\x{ff0c}\x{ff0e}\x{ff01}\x{ff1f}\x{ff1b}\x{ff1a}\x{ff08}\x{ff09}\x{ff3b}\x{ff3d}\x{ff1c}\x{ff1e},.!?;:\(\)\[\]]/u - 注意:
"和'在正则里要转义,但放在字符类[...]中无需反斜杠(除非是^、]、-这几个特殊位置) - 避免用
[\x{ff00}-\x{ffef}]这种大范围——它会把全角字母、数字甚至日文平假名也卷进来,污染结果 - 测试时务必用真实文本,比如包含
“你好。”和"Hello."的混合字符串,验证是否只命中标点
用 preg_replace_callback 做全半角标点转换时,最容易忽略的细节
单纯匹配到标点还不够,转换逻辑必须区分“可安全映射”和“不可映射”。中文句号。没有半角对应形式,强行转成英文句号.会改变语义;同理,中文引号“”转成英文""可能破坏格式。
- 只对明确有映射关系的字符做转换:全角逗号
,→半角,、全角顿号、→半角、(其实顿号没半角,但业务常约定为、保留) - 安全映射表建议用关联数组:
[',' => ',', '。' => '.', '!' => '!', '?' => '?'],然后在回调里查表返回 - 别用
ord()+ 减法算 Unicode 差值——U+FF0C(,)减 U+FE10 不等于 U+002C(,),这种“偏移算法”只适用于 ASCII 对应区(U+FF01–U+FF5E),对 U+3000 系列完全失效 - 回调函数里记得加
isset($map[$matches[0]])判断,避免未定义键触发 notice
php免费学习视频:立即使用
踏上前端学习之旅,开启通往精通之路!从前端基础到项目实战,循序渐进,一步一个脚印,迈向巅峰!











