必须添加u修饰符并确保utf-8编码:preg_match_all('//iu', $html, $matches),否则pcre按字节解析导致中文乱码;提取文本时应使用/(.?)/us配合单字节安全匹配。> ↩

preg_match_all 提取 HTML 标签时中文属性值乱码
直接用 preg_match_all('/]+>/i', $html, $matches) 能抓到标签,但里面含中文属性(比如 <div title="你好">)时,<code>$matches[0] 里中文常变问号或空格。根本不是正则写错了,而是 PCRE 按字节解析 UTF-8 多字节序列,把一个汉字拆成 2–3 个字节分别匹配,结果截断或错位。
- 必须加
u修饰符:preg_match_all('/]+>/iu', $html, $matches) - 确保源字符串是真实 UTF-8 编码——从文件读取时用
file_get_contents()后别漏掉mb_convert_encoding($html, 'UTF-8', 'auto') - 如果 HTML 来自 curl 或数据库,检查响应头或字段 collation 是否真为
utf8mb4,否则转码会失效
提取标签内中英文混合文本内容(非属性)
想从 <p>测试Test</p> 中只拿“测试Test”,不带标签、不丢标点,常见错误是写 />([^ —— 这在含中文时极易漏掉末尾字符,因为 <code>[^ 会把 UTF-8 中文的后续字节误判为“
<ul>
<li>安全写法:用 <code>strip_tags() 预处理再正则提取,或改用 DOMDocument 解析(更稳)
/(?)([\x{4e00}-\x{9fa5}a-zA-Z0-9\u3000-\u303f\uff00-\uffef\s]+)/iu,显式列出常用中文标点 Unicode 区间\u3000-\u303f 是全角 ASCII(空格、逗号、句号等),\uff00-\uffef 是全角字母数字,漏掉它们会导致“ABC123”被过滤过滤或替换标签中的中英文符号(保留文字)
业务常要清理 HTML 标签但保留中文、英文字母、数字和基础标点(如中文顿号、英文括号)。写 preg_replace('/[^a-zA-Z0-9\x{4e00}-\x{9fa5}]/u', '', $text) 看似合理,实际会删掉所有中文标点(《》【】、……、~等),因为它们不在 \x{4e00}-\x{9fa5} 范围内。
- 补全常用中文符号 Unicode 区间:
/[^\x{4e00}-\x{9fa5}\x{3000}-\x{303f}\x{3099}-\x{309c}\x{30a0}-\x{30ff}\x{ff00}-\x{ffef}a-zA-Z0-9\s]/u - 更省事:用
\p{Han}替代\x{4e00}-\x{9fa5},再加\p{P}匹配所有 Unicode 标点(需环境支持 PCRE Unicode):/[^\p{Han}\p{P}a-zA-Z0-9\s]/u - 注意
\p{P}会包含英文引号、破折号等,若只要中文标点,宁可手动列区间,避免过度保留
为什么 \w 不匹配中文,以及替代方案
\w 在 PHP 正则里默认只认 ASCII 字母、数字、下划线,即使加了 u 也不扩展含义——这是 PCRE 的设计,不是 bug。所以 preg_match('/\w+/u', '你好') 永远返回 false。
- 必须显式写范围:
[\x{4e00}-\x{9fa5}a-zA-Z0-9_]或[\p{Han}a-zA-Z0-9_] - 如果要兼容日韩文字,
\p{Script=Han}比\p{Han}更准(后者可能包含部首),但 PHP 版本需 ≥7.4 且 PCRE ≥10.30 - 别信网上抄来的
[\x{00}-\x{ff}]—— 这会把控制字符、不可见符全包进来,后续处理容易出问题
[\x{00}-\x{ff}] 不解决问题;真正要兼容,得按用途分层选区间,且每个 preg_* 函数调用都得确认 u 修饰符和输入编码链路一致。











