能实现网页变更监控,但需针对静态页用requests+beautifulsoup哈希比对,动态页用playwright等待渲染,告警走webhook并避免重复触发,同时排查cdn缓存、xhr接口及js执行时机等干扰因素。

能实现,但“实时”是相对的——HTTP 请求本身有延迟,网页可能反爬、动态渲染,直接轮询 HTML 文本容易误报或漏报。
用 requests + BeautifulSoup 抓取静态页面并比对内容
适用于不依赖 JavaScript 渲染、无登录态、无频率限制的公开页面(比如政府公告页、文档更新页)。
- 每次请求用
requests.get(url, timeout=10),务必加timeout,避免脚本卡死 - 用
BeautifulSoup(html, "html.parser")提取关键区域,比如soup.select("#content")[0].get_text(),别比对整个response.text—— 广告位、时间戳、统计脚本会频繁变动 - 哈希比对更稳定:
hashlib.md5(clean_text.encode()).hexdigest()存上一次结果,只存哈希值而非原始文本,省空间也防乱码 - 轮询间隔至少 30 秒起,太密可能被封 IP;用
time.sleep(30)而非定时任务,方便调试时 Ctrl+C 中断
遇到 JavaScript 渲染页面怎么办?Playwright 是目前最稳的选择
Selenium 太重、启动慢;Pyppeteer 已基本停更;Playwright 启动快、API 清晰、支持多浏览器,且能等元素加载完成再取内容。
- 安装:
pip install playwright,再运行playwright install chromium - 关键代码:用
page.wait_for_selector("#main-content", timeout=10000)确保目标区域已渲染,再page.inner_text("#main-content") - 注意关闭浏览器上下文:
browser.close(),否则进程残留吃光内存 - 首次运行可能因字体/环境报错,加
headless=True和slow_mo=500(仅调试)可定位问题
告警触发后怎么发通知?优先走 Webhook,别硬编码邮箱密码
邮件 SMTP 容易被当成垃圾邮件拦截;微信/钉钉/飞书都提供简单 Webhook 接口,适合脚本调用。
- 钉钉机器人需在群设置里开通,获得 webhook URL;POST 时 body 是 JSON:
{"msgtype": "text", "text": {"content": "页面已更新:xxx"}} - 用
requests.post(webhook_url, json=payload, timeout=5),加timeout防止告警阻塞主流程 - 告警要带上下文:记录变更前后的摘要(如前 100 字)、时间戳、URL,别只发“变了”
- 加个开关变量
sent_alert = False,避免连续轮询中同一变更重复告警
为什么改了内容却没触发?这几个点最容易漏
不是代码写错,而是网页本身在“骗你”:服务端返回 200 但内容没真变;CDN 缓存返回旧 HTML;页面用 localStorage 或接口异步加载正文。
- 先手动 curl -v 看响应头:
Cache-Control和ETag是否存在,有就加headers={"If-None-Match": last_etag}减少无效请求 - 打开浏览器开发者工具 → Network → 刷几次页面,看实际内容从哪个 XHR 接口来,直接请求那个 API 更准
- 某些页面用
document.write()或innerHTML动态写入,Playwright默认不等 JS 执行完,得显式page.evaluate("document.readyState === 'complete'") - 本地测试时记得清浏览器缓存,否则你以为页面变了,其实是本地缓存没刷新
真正难的从来不是“怎么写”,而是判断“变的是什么”——是标题改了?正文新增段落?还是只是广告位轮播?得根据业务目标反推抓取策略,而不是一上来就写循环。
Python免费学习笔记(深入):立即使用
在学习笔记中,你将探索 Python 的核心概念和高级技巧!











