如何从 Google 新闻 RSS Feed 中提取真实文章链接

夏伟酱_3299

夏伟酱_3299

2026-09-14

620人浏览

原创

如何从 Google 新闻 RSS Feed 中提取真实文章链接

Google 新闻 RSS Feed 中的链接是经过混淆的跳转 URL,直接请求会返回 JavaScript 重定向页而非目标文章;需通过解析 data-p 参数并调用其内部 BatchExecute 接口,才能解密获取原始文章地址。

google 新闻 rss feed 中的链接是经过混淆的跳转 url,直接请求会返回 javascript 重定向页而非目标文章;需通过解析 `data-p` 参数并调用其内部 batchexecute 接口,才能解密获取原始文章地址。

Google 新闻(news.google.com/rss/...)提供的 RSS 源看似标准 XML,但其中 <link> 标签指向的并非真实文章地址,而是形如 https://news.google.com/rss/articles/CBMiogFBVV95cUxQLUFubVFtajlobFdKQllBb1JBRDNPNm8yRE51a0N2STl3SGd6eFY2cEVMdllnM1VwNGRBbWxsa0FLUGViaHNaN2p2R2oyMWFsNklvM3pFdXZFWjNNT1dNN2lrclRzWTlLOEpOLXYzZzdETnFMS0ZUZktvZTREcmU0ZzZucmFYZk0tR1gzTVlEUWh4dXVpMGMxSWltb2x2enl1TEE?oc=5 的混淆链接。这类 URL 并非真实资源地址,而是 Google 前端 JS 用于动态加载和跳转的中间标识符——直接用 requests.get() 请求它,将收到含 <script></script> 的 HTML 页面(含 window.location.replace(...)),而非重定向到目标站点。

要可靠提取真实文章 URL,核心思路是模拟 Google 新闻前端的跳转逻辑

  1. 解析 RSS 中的混淆链接;
  2. 请求该链接,提取页面中 <c-wiz data-p="..."></c-wiz>data-p 属性值;
  3. 清洗并反序列化该 JSON 字符串(注意替换 %.@. 占位符);
  4. 构造符合 Google 内部协议的 batchexecute POST 请求体;
  5. 调用 https://news.google.com/_/DotsSplashUi/data/batchexecute 接口,解析响应中的嵌套 JSON,最终定位真实文章 URL。

以下是完整、可运行的 Python 示例(依赖 requestsbeautifulsoup4):

Google Docs Skill
Google Docs Skill

通过 OAuth 2.0 认证,集成 Google Docs API,实现文档的创建、读取、更新、格式化和管理。

下载
import requests
import json
from bs4 import BeautifulSoup

def extract_real_article_url(rss_link: str) -> str:
    # Step 1: Fetch the Google News article redirect page
    headers = {
        'User-Agent': 'Mozilla/5.0 (Windows NT 10.0; Win64; x64) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/132.0.0.0 Safari/537.36',
        'Accept': 'text/html,application/xhtml+xml,application/xml;q=0.9,*/*;q=0.8',
        'Accept-Language': 'en-US,en;q=0.5',
        'Accept-Encoding': 'gzip, deflate',
        'Connection': 'keep-alive',
    }

    resp = requests.get(rss_link, headers=headers, timeout=10)
    resp.raise_for_status()

    # Step 2: Parse data-p from c-wiz element
    soup = BeautifulSoup(resp.text, 'html.parser')
    c_wiz = soup.select_one('c-wiz[data-p]')
    if not c_wiz:
        raise ValueError("Failed to locate c-wiz[data-p] in response")

    data_p = c_wiz.get('data-p')
    # Step 3: Clean and parse data-p (Google uses custom encoding)
    try:
        # Replace placeholder and load as JSON array
        cleaned = data_p.replace('%.@.', '["garturlreq",')
        obj = json.loads(cleaned)
    except json.JSONDecodeError as e:
        raise ValueError(f"Failed to parse data-p: {e}")

    # Step 4: Build batchexecute payload
    # Keep all but last 6 elements, then append last 2 — per observed pattern
    trimmed_obj = obj[:-6] + obj[-2:]
    inner_payload = json.dumps([['Fbv4je', json.dumps(trimmed_obj), 'null', 'generic']])

    payload = {
        'f.req': json.dumps([[inner_payload]])
    }

    # Step 5: Call batchexecute endpoint
    be_url = "https://news.google.com/_/DotsSplashUi/data/batchexecute"
    be_headers = {
        'content-type': 'application/x-www-form-urlencoded;charset=UTF-8',
        'user-agent': headers['User-Agent'],
        'origin': 'https://news.google.com',
        'referer': 'https://news.google.com/',
    }

    be_resp = requests.post(be_url, headers=be_headers, data=payload, timeout=10)
    be_resp.raise_for_status()

    # Step 6: Extract real URL from nested response
    # Remove RPC wrapper: )]}'
    raw_json = be_resp.text.replace(")]}'", "")
    try:
        parsed = json.loads(raw_json)
        # Navigate: [0][2] → stringified array → [1] = final URL
        array_str = parsed[0][2]
        url_list = json.loads(array_str)
        return url_list[1]  # actual article URL
    except (IndexError, KeyError, json.JSONDecodeError, TypeError) as e:
        raise ValueError(f"Failed to extract URL from batchexecute response: {e}")

# Usage example:
if __name__ == "__main__":
    rss_item_link = "https://news.google.com/rss/articles/CBMiogFBVV95cUxQLUFubVFtajlobFdKQllBb1JBRDNPNm8yRE51a0N2STl3SGd6eFY2cEVMdllnM1VwNGRBbWxsa0FLUGViaHNaN2p2R2oyMWFsNklvM3pFdXZFWjNNT1dNN2lrclRzWTlLOEpOLXYzZzdETnFMS0ZUZktvZTREcmU0ZzZucmFYZk0tR1gzTVlEUWh4dXVpMGMxSWltb2x2enl1TEE?oc=5"
    try:
        real_url = extract_real_article_url(rss_item_link)
        print("✅ Real article URL:", real_url)
    except Exception as e:
        print("❌ Error:", str(e))

⚠️ 重要注意事项

  • 合规性与稳定性:此方法逆向了 Google 前端私有协议,不受官方支持,且极易因前端更新而失效(如 data-p 结构、BatchExecute 端点、参数签名规则变化)。生产环境请优先考虑 Google News API(需申请)、RSS 直接订阅(部分媒体提供原生 RSS),或使用合法新闻聚合服务。
  • 反爬机制:务必设置合理 User-Agent、Referer 和请求间隔;频繁调用可能触发验证码或 IP 限流。
  • 错误处理:示例中已加入基础异常捕获,实际部署时建议添加重试机制(如 tenacity)和日志记录。
  • 编码兼容性data-p 中的 %.@. 是 Google 特定占位符,不可硬编码为其他字符串;若解析失败,请检查返回 HTML 是否被动态渲染(此时需考虑 Playwright/Selenium,但违背轻量初衷)。

总结:Google RSS 链接本质是“前端跳转令牌”,绕过 JS 重定向的唯一稳健路径是复现其后端跳转协议。本方案提供了可落地的技术实现,但请始终以尊重 robots.txt、服务条款及网站可持续性为前提进行开发。

相关文章

PHP速学视频免费教程(入门到精通)
PHP速学视频免费教程(入门到精通)

PHP怎么学习?PHP怎么入门?PHP在哪学?PHP怎么学才快?不用担心,这里为大家提供了PHP速学教程(入门到精通),有需要的小伙伴保存下载就能学习啦!

下载

本站声明:本文内容由网友自发贡献,版权归原作者所有,本站不承担相应法律责任。如您发现有涉嫌抄袭侵权的内容,请联系admin@php.cn

相关专题

更多
Golang 入门学习路线:从零基础到上手开发
Golang 入门学习路线:从零基础到上手开发

Golang 入门路线涵盖从零到上手的核心路径:首先打牢基础语法与切片等底层机制;随后攻克 Go 的灵魂——接口设计与 Goroutine 并发模型;接着通过 Gin 框架与 GORM 深入 Web 开发实战;最后在微服务与云原生工具开发中进阶,旨在培养具备高性能并发处理能力的后端工程师。

2026.02.24

186

7

Golang 疑难杂症解决指南:常见问题排查与优化
Golang 疑难杂症解决指南:常见问题排查与优化

《Golang 疑难杂症解决指南》聚焦开发过程中常见却棘手的问题,从并发模型、内存管理、性能瓶颈到工程化实践逐步拆解。通过真实案例与调试思路,帮助开发者定位问题根因,建立系统化排查方法。不只给出答案,更强调分析路径与工具使用,让你在复杂 Go 项目中具备持续解决问题的能力。

2026.02.24

93

7

Golang 运行与部署实战:从本地到云端
Golang 运行与部署实战:从本地到云端

《Golang 运行与部署实战》围绕 Go 应用从开发完成到稳定上线的完整流程展开,系统讲解编译构建、环境配置、日志与配置管理、容器化部署以及常见运维问题处理。结合真实项目场景,拆解自动化构建与持续部署思路,帮助开发者建立可靠的发布流程,提升服务稳定性与可维护性。

2026.02.24

597

10

Golang 面试题精选:高频问题与解答
Golang 面试题精选:高频问题与解答

Golang 面试题精选》系统整理企业常见 Go 技术面试问题,覆盖语言基础、并发模型、内存与调度机制、网络编程、工程实践与性能优化等核心知识点。每道题不仅给出答案,还拆解背后的设计原理与考察思路,帮助读者建立完整知识结构,在面试与实际开发中都能更从容应对复杂问题。

2026.02.24

178

7

Golang 性能优化专题:提升应用效率
Golang 性能优化专题:提升应用效率

《Golang 性能优化专题》聚焦 Go 应用在高并发与大规模服务中的性能问题,从 profiling、内存分配、Goroutine 调度、GC 机制到 I/O 与锁竞争逐层分析。结合真实案例讲解定位瓶颈的方法与优化策略,帮助开发者建立系统化性能调优思维,在保证代码可维护性的同时显著提升服务吞吐与稳定性。

2026.02.24

397

7

Golang 生态工具与框架:扩展开发能力
Golang 生态工具与框架:扩展开发能力

《Golang 生态工具与框架》系统梳理 Go 语言在实际工程中的主流工具链与框架选型思路,涵盖 Web 框架、RPC 通信、依赖管理、测试工具、代码生成与项目结构设计等内容。通过真实项目场景解析不同工具的适用边界与组合方式,帮助开发者构建高效、可维护的 Go 工程体系,并提升团队协作与交付效率。

2026.02.24

168

7

Golang 并发编程专题:掌握多核时代的核心技能
Golang 并发编程专题:掌握多核时代的核心技能

《Golang 并发编程专题:掌握多核时代的核心技能》系统讲解 Go 在并发领域的设计哲学与实践方法,深入剖析 goroutine、channel、调度模型与并发安全机制,结合真实场景与性能思维,帮助开发者构建高吞吐、低延迟、可扩展的并发程序,全面提升多核时代的工程能力。

2026.02.26

504

7

Golang Web 开发路线:构建高效后端服务
Golang Web 开发路线:构建高效后端服务

《Golang Web 开发路线:构建高效后端服务》围绕 Go 在后端领域的工程实践,系统讲解 Web 框架选型、路由设计、中间件机制、数据库访问与接口规范,结合高并发与可维护性思维,逐步构建稳定、高性能、易扩展的后端服务体系,帮助开发者形成完整的 Go Web 架构能力。

2026.02.26

165

7

Golang 实际项目案例:从需求到上线
Golang 实际项目案例:从需求到上线

《Golang 实际项目案例:从需求到上线》以真实业务场景为主线,完整覆盖需求分析、架构设计、模块拆分、编码实现、性能优化与部署上线全过程,强调工程规范与实践决策,帮助开发者打通从技术实现到系统交付的关键路径,提升独立完成 Go 项目的综合能力。

2026.02.26

62

7

热门下载

更多
网站特效
/
网站源码
/
网站素材
/
前端模板

精品课程

更多
相关推荐
/
热门推荐
/
最新课程
Gemini Notebook官方手册
Gemini Notebook官方手册

共0课时 | 0人学习

Google Cloud开发者文档
Google Cloud开发者文档

共0课时 | 0人学习

Veo 3 官方文档
Veo 3 官方文档

共0课时 | 0人学习