requests.get() 拿不到 f12 中完整内容是因为它只获取服务端返回的初始 html,不执行 javascript,而页面内容由前端 js 动态渲染;若禁用 js 后页面空白或仅剩骨架,即属 js 渲染型页面。

为什么 requests.get() 拿不到 F12 里看到的完整内容
因为页面是前端 JS 渲染的,requests 只拿到服务端初始 HTML,没执行 JS,自然看不到动态插入的数据。
常见错误现象:requests.get(url).text 里搜不到页面上明明存在的商品列表、用户评论、实时价格;用 BeautifulSoup 解析后 find_all('div', class_='item') 返回空列表。
- 典型场景:电商详情页、仪表盘、单页应用(SPA)、含
React/Vue的首页 - 判断方法:禁用浏览器 JS(F12 → Settings → Disable JavaScript),刷新——如果页面空白或只剩骨架,基本就是 JS 渲染
- 服务端模板直出(如 Django/Jinja2/PHP)则
requests能直接抓到全部结构化数据,但可能含冗余 HTML 和占位符
怎么快速确认数据来源是前端还是后端
打开 F12 → Network 面板,刷新页面,按 XHR 或 Fetch 过滤,看关键数据是否来自独立接口(比如 /api/v1/products 或 /data.json)。
如果找到了,说明数据是 JS 发起请求拉取的,你不用硬啃渲染逻辑,直接模拟那个请求就行。
- 注意请求头:
Authorization、X-Requested-With、Referer常被校验,漏掉会返回403或空数据 - 参数可能动态生成:比如
timestamp、sign、token,需从页面 JS 中逆向提取(先搜fetch(或axios.get() - 部分接口返回压缩数据(
Content-Encoding: gzip),requests默认能解,但若手动处理响应体要注意
requests + 正则 / BeautifulSoup 够不够用
够用的前提是:目标数据已存在于初始 HTML 中,哪怕藏在 <script></script> 标签里(比如 window.__INITIAL_STATE__ = {...})。
这时候别急着上 Selenium,先 grep 页面源码:
response = requests.get(url)
if 'window.__INITIAL_STATE__' in response.text:
# 用正则或 json.loads(extract) 提取
- 常见藏数据位置:
<script id="__NEXT_DATA__"></script>(Next.js)、<script type="application/ld+json"></script>(SEO 结构化数据)、window.DATA = - 用
re.search(r'window\.DATA\s*=\s*(\{.*?\});', text, re.DOTALL)比盲目解析 DOM 更快更稳 - 但若数据完全由用户交互触发(比如点“加载更多”才发请求),那必须模拟行为或找接口,静态解析无解
什么时候必须用 Selenium / Playwright
只有两种情况绕不开:需要真实执行 JS 渲染,且无法定位或复现其背后的 API 请求。
比如反爬强的站点做了复杂指纹检测,或接口参数加密逻辑嵌在混淆 JS 里,短时间逆向成本过高。
- 优先选
Playwright:比Selenium启动快、API 更一致、默认支持等待网络空闲(page.wait_for_load_state('networkidle')) - 务必关掉无关功能:
headless=True、禁用图片(--blink-settings=imagesEnabled=false)、限制并发,否则慢且易被识别 - 别用
time.sleep()等渲染,改用page.wait_for_selector('.list-item'),不然在弱网或高负载下极不稳定
真正难的不是跑起来,而是判断哪一段 JS 是关键路径——多数人卡在这儿,反复试 page.evaluate() 却得不到想要的变量,其实是没找到 JS 执行完成的准确时机。
Python免费学习笔记(深入):立即使用
在学习笔记中,你将探索 Python 的核心概念和高级技巧!











