如何使用 XPath 精准提取北罗普·格鲁曼招聘页中的职位标题与链接

夜婷姑娘_1679

夜婷姑娘_1679

2026-05-15

656人浏览

原创

本文详解在 scrapy 中如何通过稳定、语义化的 xpath 表达式,从 northrop grumman 招聘页面中可靠提取职位标题(text)和职位详情页 url(@href),避免依赖易变的绝对路径。

本文详解在 scrapy 中如何通过稳定、语义化的 xpath 表达式,从 northrop grumman 招聘页面中可靠提取职位标题(text)和职位详情页 url(@href),避免依赖易变的绝对路径。

在使用 Scrapy 抓取招聘类网站时,一个常见误区是直接复制浏览器开发者工具生成的绝对 XPath(如 /html/body/div[1]/main/...)。这类路径极其脆弱:前端微调结构、插入广告位或动态加载内容都会导致表达式完全失效。Northrop Grumman 的职位列表页正是典型场景——其 DOM 结构嵌套深、层级多,但关键信息具有清晰的语义特征。

观察页面源码可发现:每个职位卡片均包裹在

容器内,其中包含一个 标签,该标签同时承载跳转链接(href 属性)和职位标题(其内部

的文本内容)。因此,应优先采用基于 class 和语义标签的相对 XPath,而非深度定位的绝对路径。

✅ 推荐 XPath 表达式如下:

  • 提取所有职位 URL(href 属性值):

    //div[@class="col-sm-9"]/a/@href
  • 提取所有职位标题(

    文本):
    //div[@class="col-sm-9"]/a/h2/text()

  • 一次性获取 URL 与标题(混合结果,按文档顺序交替):

    //div[@class="col-sm-9"]/a/@href | //div[@class="col-sm-9"]/a/h2/text()

在 Scrapy Shell 中实际使用示例:

# 启动请求并抓取响应
r = scrapy.Request('https://www.northropgrumman.com/jobs?remote=yes-may-consider-full-time-teleworking-for-this-position&country=united-states-of-america&_job_category=global-supply-chain,business-management,program-management')
fetch(r)

# 获取职位链接列表(相对路径,需拼接 base_url)
urls = response.xpath('//div[@class="col-sm-9"]/a/@href').getall()
# 输出示例: ['/jobs/Business-Management/Contract/.../R10151186/principal-sr-principal-contract-administrator', ...]

# 获取职位标题列表
titles = response.xpath('//div[@class="col-sm-9"]/a/h2/text()').getall()
# 输出示例: ['Principal / Sr Principal Contract Administrator', ...]

# 验证数量一致,便于 zip 组合
assert len(urls) == len(titles), "URL 与标题数量不匹配,请检查页面结构是否动态加载"

⚠️ 注意事项:

  • 所有 href 均为相对路径,在 Scrapy 中建议用 response.urljoin(href) 自动补全为绝对 URL;
  • 若页面启用 JavaScript 渲染(如 React 动态注入),response 可能不含完整职位数据,此时需配合 Splash 或 Playwright;
  • col-sm-9 是 Bootstrap 布局类,稳定性较高;若未来改版,可先用 response.css('div.col-sm-9 a::attr(href)').getall() 作为 CSS 选择器备选方案;
  • 始终用 .getall() 而非 .get() 进行调试,避免因单条缺失导致静默失败。

总结:XPath 的健壮性不在于“精准到第几个 div”,而在于锚定具有业务含义的容器与标签。抓住 div.col-sm-9 → a → h2 这一稳定结构链,即可实现高复用、低维护的职位数据抽取。

PHP速学视频免费教程(入门到精通)
PHP速学视频免费教程(入门到精通)

PHP怎么学习?PHP怎么入门?PHP在哪学?PHP怎么学才快?不用担心,这里为大家提供了PHP速学教程(入门到精通),有需要的小伙伴保存下载就能学习啦!

下载

相关标签:

本站声明:本文内容由网友自发贡献,版权归原作者所有,本站不承担相应法律责任。如您发现有涉嫌抄袭侵权的内容,请联系admin@php.cn

相关专题

更多
免费爬虫工具有哪些
免费爬虫工具有哪些

免费爬虫工具有Scrapy、Beautiful Soup、ParseHub、Octoparse、Webocton Scriptly、RoboBrowser和Goutte。更多关于免费爬虫工具的问题,详情请看本专题下面的文章。php中文网欢迎大家前来学习。

2023.11.10

4533

9

Python爬虫获取数据的方法
Python爬虫获取数据的方法

Python爬虫可以通过请求库发送HTTP请求、解析库解析HTML、正则表达式提取数据,或使用数据抓取框架来获取数据。更多关于Python爬虫相关知识。详情阅读本专题下面的文章。php中文网欢迎大家前来学习。

2023.11.13

653

12

LLVM自定义Pass怎么写
LLVM自定义Pass怎么写

本专题聚焦LLVM自定义Pass开发,整理Pass类结构、run()方法、PreservedAnalyses、CMake构建、插件注册、-load-pass-plugin加载和测试用例编写流程。

2026.09.30

120

10

LLVM RISC-V参数配置教程
LLVM RISC-V参数配置教程

本专题介绍LLVM对RISC-V基础ISA和扩展的支持方式,涵盖RV32、RV64、标准扩展、实验性扩展、厂商扩展、-menable-experimental-extensions和版本差异。

2026.09.30

100

14

LLVM IR中间表示入门指南
LLVM IR中间表示入门指南

本专题整理LLVM IR的核心概念,包括中间表示作用、模块结构、函数、基本块、SSA形式、类型系统和常见语法,帮助新手理解LLVM编译流程中的关键层。

2026.09.30

80

12

PDF转图片方法
PDF转图片方法

需要把 PDF 页面用于上传、预览、分享或图片归档时,PDF 转图片方法专题整理 JPG/PNG 格式选择、逐页导出、清晰度设置、批量下载和结果检查等流程,帮助用户稳定完成 PDF 图片化处理。

2026.09.30

60

26

PixTV AI视频生成与无限画布创作
PixTV AI视频生成与无限画布创作

PixTV专题整理AI视频与视觉内容创作相关功能使用教程,涵盖AI生图、视频生成、无限画布、多模型创作、素材管理、声音音乐及视频剪辑等功能,帮助用户快速掌握PixTV从创意到成片的完整制作方法。

2026.09.29

80

15

Buffalo框架数据库开发全教程
Buffalo框架数据库开发全教程

本专题围绕Buffalo框架数据库开发,讲解database.yml多环境配置、soda与fizz迁移生成回滚、模型结构体标签、增删改查与条件查询、一对多与多对多关联、数据校验、回调钩子、事务处理及原生SQL执行能力。

2026.09.23

280

15

Buffalo框架路由与请求处理实操指南
Buffalo框架路由与请求处理实操指南

本专题讲解Buffalo框架路由与请求处理机制,涵盖路由注册与分组、资源路由、Handler编写规范、Context上下文方法、参数绑定、中间件编写挂载、Session与Cookie读写、Flash消息及错误页面定制方法。

2026.09.23

180

15

热门下载

更多
网站特效
/
网站源码
/
网站素材
/
前端模板

精品课程

更多
热门推荐
/
最新课程
phpStudy极速入门视频教程
phpStudy极速入门视频教程

共6课时 | 54.6万人学习

独孤九贱(4)_PHP视频教程
独孤九贱(4)_PHP视频教程

共89课时 | 133.4万人学习