最稳妥方案是使用libxml2配合xpath解析:先用htmlreadmemory加载html并启用html_parse_recover容错,再用xmlxpathevalexpression执行"//p[not(ancestor::script) and not(ancestor::style)]"定位p标签,最后调用xmlnodegetcontent获取已解码的纯文本内容。

用 libxml2 提取 <p></p> 标签内容最稳妥
纯 C++ 没有标准 HTML 解析器,硬写正则匹配 <p></p> 或 <div> 会翻车——嵌套、属性、换行、CDATA 都能让你的正则崩掉。直接上 <code>libxml2 是工程中最常选的方案,它支持 XPath,能准确定位任意标签结构。
安装后链接 -lxml2,关键步骤:先用 xmlReadMemory() 加载 HTML 字符串(注意传 HTML_PARSE_RECOVER 标志容错),再用 xmlXPathEvalExpression() 执行 "//p" 这类路径。别漏掉 xmlKeepBlanksDefault(0),否则文本节点里一堆换行和空格。
xmlDocPtr doc = htmlReadMemory(html_str, len, "", NULL, HTML_PARSE_RECOVER | HTML_PARSE_NOERROR);- 查到的
xmlNodePtr要用xmlNodeGetContent()取纯文本,不是content字段直读 - 如果 HTML 有
<script></script>或<style></style>,XPath 默认也会匹配进去,得加过滤:"//p[not(ancestor::script) and not(ancestor::style)]"
遇到 malformed HTML 时 htmlcxx 比 libxml2 更宽容
libxml2 在遇到严重语法错误(比如未闭合的 <table> 嵌套)时可能返回空文档或崩溃;<code>htmlcxx 底层基于词法分析,对现实网页中常见的“脏 HTML”容忍度更高,适合爬虫后处理。
它不支持 XPath,得手动遍历 DOM 树。核心是 htmlcxx::HTML::ParserDom 的 parseTree() 返回 htmlcxx::HTML::Node,然后递归调用 getChildNodes() 查找 tagName() == "p" 的节点。
- 必须用
node->isTag()判断是否为标签节点,否则文本节点也进循环 -
node->getText()返回的是该节点内所有子文本拼接结果,不含子标签;要保留结构就得自己递归提取 - 它不自动解码 HTML 实体(如
),需额外调用htmlcxx::HTML::decodeEntities()
std::regex 只能应付极简场景,且必须避开这些坑
真要用正则,仅限于你完全控制 HTML 格式(比如自动生成的、无嵌套、无属性、无换行的 <span class="price">199</span>)。一旦出现 <span><span>199</span></span> 或 <span data-value="<div>">xxx</span>,std::regex 就失效。
- 不要写
R"(<span>(.*?)</span>)"——.不匹配换行,得加std::regex_constants::dot_not_newline以外的标志,但 C++11 的std::regex对多行支持弱 - 属性值里的引号(单/双)和转义(
")会让模式爆炸,没预处理基本没法写全 - 性能差:对 10KB HTML,
std::regex_search可能比libxml2慢 5–10 倍,且内存占用不可控
提取后文本含 HTML 实体?优先用 libxml2 自带的 xmlNodeGetContent()
很多解析库返回的是原始字符数据,像 、< 还原成空格和 得自己处理。而 <code>libxml2 的 xmlNodeGetContent() 默认已做实体展开,只要文档加载时没关掉解析选项。
如果你用的是其他库(比如 htmlcxx 或手写解析),别自己写映射表——libxml2 提供了 htmlEntityLookup() 和完整实体表,但调用复杂;更实际的做法是引入轻量级 gumbo-parser(Google 开源),它的 gumbo_get_text() 直接返回已解码字符串。
-
libxml2的xmlNodeGetContent()对'(Unicode 十六进制)也支持,但对{(十进制)支持不稳定,建议统一用xmlNodeGetContent()+xmlChar转std::string流程 - 别在提取前用
std::replace简单替换" ",因为真实 HTML 中可能有(即 字面量)
libxml2 和 gumbo-parser 是最省心的组合:前者稳,后者快且专为 HTML 设计。但无论选哪个,都得亲自喂一段真实页面 HTML 测试——特别是含 SVG、MathML 或注释的页面,很多解析器默认跳过它们。











