
本文教你绕过 javascript 渲染陷阱,通过分析网页资源网络请求,直接调用后端 json 接口获取真实 episode 标题,避免 selenium 等重量级方案,实现高效、稳定、可批量的网络数据采集。
本文教你绕过 javascript 渲染陷阱,通过分析网页资源网络请求,直接调用后端 json 接口获取真实 episode 标题,避免 selenium 等重量级方案,实现高效、稳定、可批量的网络数据采集。
在网页爬虫实践中,常遇到一种典型场景:目标文本(如 <h1 id="epName">...</h1>)初始仅显示省略号,实际内容需经 JavaScript 动态加载(例如执行 initPage() 或 changeEp() 后才填充)。此时,使用 requests 直接抓取 HTML 会返回空标签;而盲目使用 Selenium 又可能因未等待 JS 执行完成、或未正确触发事件导致失败——正如你在 Safari 驱动中调用 driver.execute_script('changeEp') 却仍未获取到内容。
根本解法不是“等 JS 渲染”,而是“找数据源头”。通过浏览器开发者工具(F12 → Network 选项卡),刷新页面并筛选 XHR/Fetch 请求,可快速定位该站点的真实数据接口:https://fim.heartshine.gay/db.json。该 JSON 文件由前端脚本 viewEp.js 加载,结构清晰,完全包含所有季集元数据。
以下为推荐的轻量级、高性能解决方案:
import requests # 1. 直接请求结构化数据源 url = 'https://fim.heartshine.gay/db.json' response = requests.get(url) response.raise_for_status() # 确保请求成功 data = response.json() # 2. 按 season=1, episode=1 提取标题(注意:索引从0开始) title = data['series']['seasons'][0]['episodes'][0]['epTitle'] print(title) # 输出:Friendship is Magic, Part 1
如需批量处理全部剧集,建议转为 Pandas DataFrame 进行结构化管理:
详细的 Three.js 3D 图形参考,涵盖场景设置、相机、几何体、材质、光照、动画、控制器、加载器、数学工具和调试。
import pandas as pd
# 展平嵌套 JSON:按 seasons → episodes 层级展开
seasons = data['series']['seasons']
df = pd.json_normalize(
seasons,
record_path='episodes',
meta=['seasNum'], # 提取上级 season 编号
errors='ignore'
)[['seasNum', 'epNum', 'epTitle']] # 保留关键字段
# 示例:查看前2集与最后2集
print(df.iloc[[0, 1, -2, -1]])
✅ 优势总结:
- 零渲染开销:跳过浏览器自动化,响应更快、内存占用低;
-
强健可靠:不依赖 DOM 状态或 JS 执行时序,规避
NoSuchElementException等常见异常; -
易于扩展:支持
requests.Session()复用连接、添加 headers/cookies、设置超时; - 便于维护:JSON Schema 稳定,比 XPath/CSS 选择器更抗 HTML 结构变更。
⚠️ 注意事项:
- 始终检查
response.status_code或使用raise_for_status(),防止静默失败; - 若接口要求 Referer 或 User-Agent,请在
requests.get()中显式传入headers参数; - 生产环境建议添加重试机制(如
tenacity库)和缓存策略(如requests-cache),提升鲁棒性与效率。
掌握“追踪网络请求→定位 API→解析 JSON”这一链路,是现代 Web Scraping 的核心能力——它让你从被动等待渲染,转向主动对接数据源。
大量免费API接口:立即使用
涵盖生活服务API、金融科技API、企业工商API、等相关的API接口服务。免费API接口可安全、合规地连接上下游,为数据API应用能力赋能!










