requests.get() 拿不到真实数据是因为 spa 初始 html 仅为骨架(如),真实内容由后续 js 发起的 fetch/axios 请求动态填充,而 requests 不执行 javascript,故仅见“加载中”。

requests.get() 拿不到真实数据,因为 SPA 的内容由 JavaScript 动态渲染,你看到的“加载中”就是初始 HTML 里唯一存在的 DOM 节点。
为什么直接请求 HTML 只能看到“加载中”
SPA 页面首次返回的 HTML 几乎是空骨架,<div id="app"></div> 或类似占位符后面没有真实内容。所有列表、商品、用户信息都靠后续 fetch 或 axios 请求填充——而 requests 不执行 JS,自然卡在 loading 状态。
- 浏览器开发者工具里打开 Network → XHR,刷新页面,找带
api、list、feed关键字的请求 - 检查这些请求的
Response是否为 JSON,且结构匹配你看到的数据 - 注意请求头:
Referer和User-Agent常被校验,缺失易返回 403 或空数据
用 Playwright 拦截 XHR 请求比等页面渲染更稳
比起等某个元素出现(比如 WebDriverWait 等 presence_of_element_located),直接监听并捕获 XHR 更快、更准,也绕开了大量无用资源加载。
SkillSub Pro - Python 题解与代码注释双功能技能功能概述SkillSub Pro - Python 题解与代码注释双功能技能是一项面向实际任务的技能,主要用于SkillSub Pro 是一个 Python 题解生成与代码注释的 双功能合体技能 ,专为学生、算法学习者和开发者设计;✅ 一个技能,两种用途 :;核心要点📝 题解模式 :输入题目/题号,自动生成完整 Python 题解(含详细注释、解题思路、复杂度分析);💬 注释模式 :输入 Python 代码,自动添加详细中。它将相关步骤、
- Playwright 的
page.route()或page.on("response")可以过滤出目标 API 请求 - 配合
page.goto(url, wait_until="networkidle")会等所有网络请求结束,但耗时长、易超时 - 推荐写法:先
page.goto(),再用page.wait_for_response("https://.*/api/.*")等待关键接口返回
Browserless 适合部署但要注意 token 和 timeout
调用 https://chrome.browserless.io/content 是远程跑 Chrome,省去本地维护浏览器的麻烦,但不是万能解药。
-
waitUntil: "networkidle0"表示等待 500ms 内无网络请求,对含轮询或埋点的 SPA 可能过早结束 - 响应体是完整 HTML 字符串,仍需解析;如果目标数据藏在 JS 变量里(如
window.__INITIAL_STATE__),得额外用正则或page.evaluate()提取 - token 过期或配额用尽时,错误信息是
{"error":"Unauthorized"},不是 HTTP 401,容易误判
Python免费学习笔记(深入):立即使用
在学习笔记中,你将探索 Python 的核心概念和高级技巧!










