评论数据藏在滚动加载后的dom里,requests拿不到,因其依赖js动态插入,需通过network面板抓取ajax请求,复现headers、参数及登录态,或用selenium配合webdriverwait精准等待并防检测。

评论数据藏在滚动加载后的 DOM 里,requests 拿不到
直接用 requests 请求页面源码,拿到的 HTML 里根本没有后续评论——因为它们是 JS 动态插入的,通常靠监听 window.onscroll 或点击“加载更多”按钮触发 AJAX 请求。这时候硬解析静态 HTML 是白忙活。
实操建议:
- 先打开浏览器开发者工具(F12),切到
Network→XHR或Fetch标签,手动滚动或点“加载更多”,观察发起的新请求:URL、请求方法、Headers(尤其Referer和Cookie)、Query 参数或 Request Payload - 多数情况是 GET 请求带分页参数(如
offset=20、limit=10)或 POST 请求发 JSON(如{"cursor": "xxx"}) - 注意请求是否依赖登录态:
Cookie或Authorization头必须复现,否则返回 401 或空数据
用 selenium 滚动到底部但评论还是没加载出来
常见现象:调了 driver.execute_script("window.scrollTo(0, document.body.scrollHeight);"),等了几秒,driver.page_source 里仍没新评论。问题不在滚动动作本身,而在时机和触发条件。
实操建议:
- 滚动后不能只
time.sleep(2),要用WebDriverWait等待特定元素出现,比如新加载的评论项div.comment-item或“加载中”文字消失 - 有些站点用 Intersection Observer,需要真正让目标区域进入视口,仅滚动到底部不够,得用
driver.execute_script("arguments[0].scrollIntoView(true);", element)滚动到某个占位节点 - 防检测:加
options.add_argument("--disable-blink-features=AutomationControlled"),并删掉webdriver属性,否则可能被识别为 bot 导致接口限流
逆向分析出 API 后,用 requests 调用却返回 403 或空数据
看似拿到了正确 URL 和参数,但服务端做了签名、时间戳、加密字段或设备指纹校验。典型表现是:浏览器能正常访问,requests 却被拦。
实操建议:
- 对比浏览器请求和 Python 请求的完整 Headers,重点检查:
User-Agent(需匹配真实浏览器)、Accept-Language、X-Requested-With,缺一不可 - 查看请求 URL 是否含动态参数,比如
ts=1715623489234(毫秒级时间戳)或sign=xxx(需从 JS 中提取生成逻辑) - 某些平台(如小红书、抖音)会校验
cookie中的sessionid+websectoken组合,且后者有时效性,必须复用登录后的真实 cookie 字符串,不能只复制部分
评论翻页时出现重复或漏抓,cursor 和 offset 怎么选?
不同平台分页机制差异极大:有的靠单调递增 offset(如 offset=0, offset=20),有的靠游标 cursor(如 "next": "eyJsYXN0X2lkIjoyMDQ4LCJsaW1pdCI6MjB9" Base64 编码),还有的混合使用。
实操建议:
- 每次响应里找分页线索:
data.next_cursor、data.has_more、data.total、data.after,别自己硬算 offset - 游标类接口严禁修改或解码后篡改,直接原样传入下一次请求;Base64 游标可能含校验字段,解码再编码会导致失效
- 遇到“已加载全部”但实际还有评论,可能是接口按热度排序而非时间,换用
sort_type=2(时间倒序)等参数试试
滚动加载本质是前端对分页逻辑的封装,真正难的从来不是“怎么滚”,而是搞清背后那套不透明的分页协议和反爬约束。参数错一位、Header 少一个字段、时间戳差几毫秒,都可能让整页数据消失。
Python免费学习笔记(深入):立即使用
在学习笔记中,你将探索 Python 的核心概念和高级技巧!











