htmlagilitypack 抓网页易卡在三处:documentnode 为 null(需判空及正确解码)、xpath 查不到节点(仅支持 xpath 1.0,勿用 css 语法)、innertext 含乱码和标签(应先删 script/style 再正则清理)。

直接用 HtmlAgilityPack 抓网页数据,最容易卡在三件事上:解析后 DocumentNode 为 null、XPath 查不到节点、提取的文本混着 <script></script> 和乱码空格。别碰正则解析 HTML,也别指望它自动识别 charset。
HtmlDocument.LoadHtml() 后 DocumentNode 为空怎么办
这不是 HTML 有错,而是你传了空字符串、网络响应失败返回的空内容,或没处理编码导致解析中断——DocumentNode 就是 null,后续所有 SelectNodes() 都会崩。
- 永远先写
if (doc.DocumentNode == null) return;或抛异常,别跳过这步 - 用
LoadHtml(htmlString?.Trim())前加判空:if (string.IsNullOrWhiteSpace(htmlString)) - 从 HTTP 拿内容时,别直接丢给
LoadHtml():先检查HttpResponseMessage.IsSuccessStatusCode,再确保字符串已按响应头的Content-Type正确解码(比如text/html; charset=utf-8就得用Encoding.UTF8) - 解析 HTML 片段(如只有
<div>xxx</div>)时,手动包一层:doc.LoadHtml($"{fragment}");
SelectNodes("//div[@class='content']") 返回空列表
浏览器里能看见,代码里查不到?大概率是 XPath 写法和 HTML 实际结构对不上——HtmlAgilityPack 只支持 XPath 1.0,不认 CSS 选择器,也不自动处理 class 多值、大小写、引号类型。
如果你了解HTML,CSS和JavaScript,您已经拥有所需的工具开发Android应用程序。本动手本书展示了如何使用这些开源web标准设计和建造,可适应任何Android设备的应用程序 - 无需使用Java。您将学习如何创建一个在您选择的平台的Android友好的网络应用程序,然后转换与自由PhoneGap框架到一个原生的Android应用程序。了解为什么设备无关的移动应用是未来的潮流,并开始构建应用程序,提供更
-
SelectNodes()参数必须是 XPath 表达式,"div.content"这种 CSS 写法会静默返回空 - class 含多个值(如
class="content main")时,别用@class='content',改用contains(@class, 'content');要精准匹配,用normalize-space(@class) = 'content main'(注意空格和顺序必须完全一致) - 属性值含单引号?把整个 XPath 改用双引号包裹:
"//a[@href=\"http://x.com?q=a'b\"]" - 更稳的方式是绕过 XPath:用
doc.DocumentNode.Descendants("div")拿到所有<div>,再手动过滤 <code>node.GetAttributeValue("class", "")InnerText 提取的文本带换行、\u00A0、script 标签内容
InnerText不是“干净文本”,它是模拟浏览器渲染逻辑的粗略结果:保留换行、合并空白但不清理 Unicode 空格,还把<script></script>和<style></style>里的内容也吞进去。- 要真正干净的文本,别依赖
InnerText:先用Regex.Replace(node.InnerHtml, @"]*>", "")去标签,再用Regex.Replace(text, @"[\s\u00A0\u2000-\u200F\u2028\u2029]+", " ").Trim()清理空白 - 如果只要可见文本(排除
<script></script>/<style></style>),得先删掉这些节点:doc.DocumentNode.SelectNodes("//script | //style")?.ToList().ForEach(n => n.Remove()); -
PreserveWhitespace = true会影响中文缩进显示,有时看着像“丢字”,其实是空白被保留了——设为false再试
最常被忽略的一点:
HtmlAgilityPack的HtmlWeb类默认不复用连接、不设超时、不传 User-Agent,遇到反爬网站直接 403;而HtmlDocument实例不能跨请求复用,尤其用了OptionFixNestedTags = true后状态会残留。真要稳定抓取,HttpClient+ 手动解码 +HtmlDocument单次构造,才是可控路径。 - 要真正干净的文本,别依赖










