Python网页源码与F12看到的不一样_前端JS渲染数据与服务端模板直出区别解析排查

云敏姑娘_1477

云敏姑娘_1477

2026-03-20

299人浏览

原创

requests.get() 拿不到 f12 中完整内容是因为它只获取服务端返回的初始 html,不执行 javascript,而页面内容由前端 js 动态渲染;若禁用 js 后页面空白或仅剩骨架,即属 js 渲染型页面。

python网页源码与f12看到的不一样_前端js渲染数据与服务端模板直出区别解析排查

为什么 requests.get() 拿不到 F12 里看到的完整内容

因为页面是前端 JS 渲染的,requests 只拿到服务端初始 HTML,没执行 JS,自然看不到动态插入的数据。

常见错误现象:requests.get(url).text 里搜不到页面上明明存在的商品列表、用户评论、实时价格;用 BeautifulSoup 解析后 find_all('div', class_='item') 返回空列表。

  • 典型场景:电商详情页、仪表盘、单页应用(SPA)、含 React/Vue 的首页
  • 判断方法:禁用浏览器 JS(F12 → Settings → Disable JavaScript),刷新——如果页面空白或只剩骨架,基本就是 JS 渲染
  • 服务端模板直出(如 Django/Jinja2/PHP)则 requests 能直接抓到全部结构化数据,但可能含冗余 HTML 和占位符

怎么快速确认数据来源是前端还是后端

打开 F12 → Network 面板,刷新页面,按 XHR 或 Fetch 过滤,看关键数据是否来自独立接口(比如 /api/v1/products 或 /data.json)。

如果找到了,说明数据是 JS 发起请求拉取的,你不用硬啃渲染逻辑,直接模拟那个请求就行。

  • 注意请求头:Authorization、X-Requested-With、Referer 常被校验,漏掉会返回 403 或空数据
  • 参数可能动态生成:比如 timestamp、sign、token,需从页面 JS 中逆向提取(先搜 fetch( 或 axios.get()
  • 部分接口返回压缩数据(Content-Encoding: gzip),requests 默认能解,但若手动处理响应体要注意

requests + 正则 / BeautifulSoup 够不够用

够用的前提是:目标数据已存在于初始 HTML 中,哪怕藏在 <script></script> 标签里(比如 window.__INITIAL_STATE__ = {...})。

python-pro
python-pro

高级 Python 特性、异步编程、性能调优、静态类型、内存管理、Python 内部机制及生态库方面的专家。

下载

这时候别急着上 Selenium,先 grep 页面源码:

response = requests.get(url)
if 'window.__INITIAL_STATE__' in response.text:
    # 用正则或 json.loads(extract) 提取
  • 常见藏数据位置:<script id="__NEXT_DATA__"></script>(Next.js)、<script type="application/ld+json"></script>(SEO 结构化数据)、window.DATA =
  • 用 re.search(r'window\.DATA\s*=\s*(\{.*?\});', text, re.DOTALL) 比盲目解析 DOM 更快更稳
  • 但若数据完全由用户交互触发(比如点“加载更多”才发请求),那必须模拟行为或找接口,静态解析无解

什么时候必须用 Selenium / Playwright

只有两种情况绕不开:需要真实执行 JS 渲染,且无法定位或复现其背后的 API 请求。

比如反爬强的站点做了复杂指纹检测,或接口参数加密逻辑嵌在混淆 JS 里,短时间逆向成本过高。

  • 优先选 Playwright:比 Selenium 启动快、API 更一致、默认支持等待网络空闲(page.wait_for_load_state('networkidle'))
  • 务必关掉无关功能:headless=True、禁用图片(--blink-settings=imagesEnabled=false)、限制并发,否则慢且易被识别
  • 别用 time.sleep() 等渲染,改用 page.wait_for_selector('.list-item'),不然在弱网或高负载下极不稳定

真正难的不是跑起来,而是判断哪一段 JS 是关键路径——多数人卡在这儿,反复试 page.evaluate() 却得不到想要的变量,其实是没找到 JS 执行完成的准确时机。

Python免费学习笔记(深入):立即使用
在学习笔记中,你将探索 Python 的核心概念和高级技巧!

相关专题

更多
python是前端还是后端
python是前端还是后端

Python属于前端也属于后端,其灵活性和丰富的生态系统使得开发人员能够在不同的领域中灵活运用。本专题为大家提供python相关的文章、下载、课程内容,供大家免费下载体验。

2023.08.11

2343

5

前端如何实现即时通讯
前端如何实现即时通讯

实现即时通讯的方法有WebSocket、Long Polling、Server-Sent Events、WebRTC等等。详细介绍:1、WebSocket,它可以在客户端和服务器之间建立持久连接,实现实时的双向通信,前端可以使用 WebSocket API来创建WebSocket连接,并通过发送和接收消息来实现即时通讯;2、Long Polling,是一种模拟实时通信的技术等等。

2023.10.09

5043

6

前端和后端的区别
前端和后端的区别

前端关注的是用户界面的设计和交互,而后端则注重数据处理和逻辑控制。想了解更多前端后端的相关内容,可以阅读本专题下面的文章。

2024.03.19

6130

13

php和前端的关联介绍
php和前端的关联介绍

php既可以作为前端语言,也可以作为后端语言。想了解更多php和前端的相关内容,可以阅读本专题下面的文章。

2024.03.22

5658

10

前端外包工作内容有哪些
前端外包工作内容有哪些

前端外包工作内容包括:1. 网站和应用程序开发;2. 用户界面和交互设计;3. 用户体验优化;4. 设计和视觉开发;5. 跨浏览器兼容性;6. 性能优化;7. 维护和更新;8. 项目管理和沟通。想了解更多前端的相关内容,可以阅读本专题下面的文章。

2024.05.22

803

5

python打包成可执行文件
python打包成可执行文件

本专题为大家带来python打包成可执行文件相关的文章,大家可以免费的下载体验。

2023.07.20

1671

4

python能做什么
python能做什么

python能做的有:可用于开发基于控制台的应用程序、多媒体部分开发、用于开发基于Web的应用程序、使用python处理数据、系统编程等等。本专题为大家提供python相关的各种文章、以及下载和课程。

2023.07.25

4224

7

format在python中的用法
format在python中的用法

Python中的format是一种字符串格式化方法,用于将变量或值插入到字符串中的占位符位置。通过format方法,我们可以动态地构建字符串,使其包含不同值。php中文网给大家带来了相关的教程以及文章,欢迎大家前来阅读学习。

2023.07.31

1669

3

python教程
python教程

Python已成为一门网红语言,即使是在非编程开发者当中,也掀起了一股学习的热潮。本专题为大家带来python教程的相关文章,大家可以免费体验学习。

2023.08.03

24557

23

热门下载

更多
网站特效
/
网站源码
/
网站素材
/
前端模板

精品课程

更多
相关推荐
/
热门推荐
/
最新课程