如何使用 Selenium 正确定位 Reddit 评论(t1_ 开头)元素?

花韻仙語

花韻仙語

2026-05-18

904人浏览

原创

Reddit 页面大量使用 Shadow DOM,导致 Selenium 无法直接通过 ID(如 t1_xxx)定位评论元素;必须逐层进入嵌套的 shadow-root 才能访问其内部 DOM。

reddit 页面大量使用 shadow dom,导致 selenium 无法直接通过 id(如 `t1_xxx`)定位评论元素;必须逐层进入嵌套的 shadow-root 才能访问其内部 dom。

Reddit(尤其是新版 Reddit)广泛采用 Web Components 技术,其评论区域、投票按钮、用户信息卡等关键交互模块均被封装在多层 Shadow DOM 中。这与

✅ 正确做法是:显式定位 shadow host 元素 → 获取其 shadow_root 属性 → 在该 shadow root 下继续查找子元素。若存在多层嵌套(Reddit 常见 2–3 层),需递归/循环进入。

以下是一个适配 Reddit 评论截图的增强版函数示例:

Amazon Quick
Amazon Quick

亚马逊推出的生成式桌面AI智能体工作台

下载
from selenium import webdriver
from selenium.webdriver.common.by import By
from selenium.webdriver.support.ui import WebDriverWait
from selenium.webdriver.support import expected_conditions as EC

def get_screenshot_of_reddit_element(driver, handle_id, max_shadow_depth=4):
    """
    在含多层 Shadow DOM 的 Reddit 页面中,定位并返回指定 ID 的元素(支持 t1_ 评论 / t3_ 帖子)
    """
    # Step 1: 确保页面已加载基础 DOM
    WebDriverWait(driver, 30).until(
        lambda d: d.execute_script("return document.readyState") == "complete"
    )

    # Step 2: 从 document.documentElement 开始,逐层查找 shadow-root 并进入
    current_context = driver.execute_script("return document.documentElement")

    for depth in range(max_shadow_depth):
        # 尝试在当前上下文中直接查找目标元素(可能位于 light DOM 或最内层 shadow DOM)
        try:
            element = current_context.find_element(By.ID, handle_id)
            return element
        except:
            pass

        # 否则查找下一个 shadow host(常见选择器:含 shadow-root 的容器,如 [role="main"]、.Comment, 或 data-test-id)
        try:
            # Reddit 常见 shadow host:主内容区、评论列表容器
            shadow_host = current_context.find_element(
                By.CSS_SELECTOR, 
                "article, [data-testid='post-container'], [role='main'], .Comment, [data-test-id='comment']"
            )
            # 获取其 shadow root(Selenium 4.5+ 原生支持)
            current_context = shadow_host.shadow_root
        except:
            # 若无更多 shadow-root,跳出循环,尝试 fallback 查找
            break

    # Final fallback: 使用 JavaScript 直接遍历所有 shadow roots(更鲁棒)
    script = """
    function findInShadowRoots(root, targetId) {
        if (root.getElementById(targetId)) return root.getElementById(targetId);
        const hosts = root.querySelectorAll('*');
        for (let host of hosts) {
            if (host.shadowRoot) {
                const found = findInShadowRoots(host.shadowRoot, targetId);
                if (found) return found;
            }
        }
        return null;
    }
    return findInShadowRoots(document.documentElement, arguments[0]);
    """
    element = driver.execute_script(script, handle_id)
    if not element:
        raise NoSuchElementException(f"Element with ID '{handle_id}' not found in any shadow DOM layer")
    return element

# 使用示例(整合进原函数)
def getScreenshotOfPost(header, ID, url):
    driver = webdriver.Chrome()
    try:
        driver.get(url)
        driver.set_window_size(width=400, height=1600)
        driver.execute_script("window.focus();")

        handle = f"{header}{ID}"

        # ✅ 关键替换:不再用 WebDriverWait + By.ID 直查,改用 shadow-aware 定位
        element = get_screenshot_of_reddit_element(driver, handle)

        # 截图保存
        fp = open(f'Post_{header}{ID}.png', "wb")
        fp.write(element.screenshot_as_png)
        fp.close()
    finally:
        driver.quit()

⚠️ 重要注意事项

  • Selenium 版本要求:必须使用 Selenium 4.5 或更高版本,才能原生支持 .shadow_root 属性(旧版本需依赖 execute_script 模拟)。
  • 动态加载:Reddit 评论常按需懒加载(infinite scroll),若目标评论未渲染,需先滚动触发加载,例如:driver.execute_script("arguments[0].scrollIntoView(true);", comment_container)。
  • ID 可靠性:虽然 t1_... 是 Reddit 官方 ID 格式,但部分新组件可能使用 data-test-id 或 aria-labelledby 等替代属性,建议结合浏览器开发者工具的 “Elements → Shadow DOM 切换” 面板验证实际结构。
  • 性能权衡:深度遍历 shadow DOM 会增加耗时,生产环境建议结合具体页面结构预设 host 选择器(如 #main-content > div > div > div > div > div > article),避免全量递归。

总结:Reddit 的 Shadow DOM 不是 bug,而是现代前端架构的必然设计。解决它的核心不是“换定位方式”,而是理解并尊重其作用域隔离机制——主动切换上下文,而非期待 Selenium 自动穿透。掌握这一模式后,不仅 Reddit,所有基于 Web Components 的 SPA(如某些企业级管理后台)都将迎刃而解。

相关文章

PHP速学视频免费教程(入门到精通)
PHP速学视频免费教程(入门到精通)

PHP怎么学习?PHP怎么入门?PHP在哪学?PHP怎么学才快?不用担心,这里为大家提供了PHP速学教程(入门到精通),有需要的小伙伴保存下载就能学习啦!

下载

相关标签:

本站声明:本文内容由网友自发贡献,版权归原作者所有,本站不承担相应法律责任。如您发现有涉嫌抄袭侵权的内容,请联系admin@php.cn

相关专题

更多
python打包成可执行文件
python打包成可执行文件

本专题为大家带来python打包成可执行文件相关的文章,大家可以免费的下载体验。

2023.07.20

1104

4

python能做什么
python能做什么

python能做的有:可用于开发基于控制台的应用程序、多媒体部分开发、用于开发基于Web的应用程序、使用python处理数据、系统编程等等。本专题为大家提供python相关的各种文章、以及下载和课程。

2023.07.25

2047

7

format在python中的用法
format在python中的用法

Python中的format是一种字符串格式化方法,用于将变量或值插入到字符串中的占位符位置。通过format方法,我们可以动态地构建字符串,使其包含不同值。php中文网给大家带来了相关的教程以及文章,欢迎大家前来阅读学习。

2023.07.31

1184

3

python教程
python教程

Python已成为一门网红语言,即使是在非编程开发者当中,也掀起了一股学习的热潮。本专题为大家带来python教程的相关文章,大家可以免费体验学习。

2023.08.03

8587

23

python环境变量的配置
python环境变量的配置

Python是一种流行的编程语言,被广泛用于软件开发、数据分析和科学计算等领域。在安装Python之后,我们需要配置环境变量,以便在任何位置都能够访问Python的可执行文件。php中文网给大家带来了相关的教程以及文章,欢迎大家前来学习阅读。

2023.08.04

1453

5

python eval
python eval

eval函数是Python中一个非常强大的函数,它可以将字符串作为Python代码进行执行,实现动态编程的效果。然而,由于其潜在的安全风险和性能问题,需要谨慎使用。php中文网给大家带来了相关的教程以及文章,欢迎大家前来学习阅读。

2023.08.04

1504

5

scratch和python区别
scratch和python区别

scratch和python的区别:1、scratch是一种专为初学者设计的图形化编程语言,python是一种文本编程语言;2、scratch使用的是基于积木的编程语法,python采用更加传统的文本编程语法等等。本专题为大家提供scratch和python相关的文章、下载、课程内容,供大家免费下载体验。

2023.08.11

860

5

python合并两个列表
python合并两个列表

Python是一种强大的编程语言,具有许多方便的功能和工具。在Python中,有多种方法可以合并两个列表。php中文网给大家带来了相关的教程以及文章,欢迎大家前来学习阅读。

2023.08.10

530

4

python是前端还是后端
python是前端还是后端

Python属于前端也属于后端,其灵活性和丰富的生态系统使得开发人员能够在不同的领域中灵活运用。本专题为大家提供python相关的文章、下载、课程内容,供大家免费下载体验。

2023.08.11

1086

5

热门下载

更多
网站特效
/
网站源码
/
网站素材
/
前端模板

精品课程

更多
相关推荐
/
热门推荐
/
最新课程
誉天教育RHCE视频教程
誉天教育RHCE视频教程

共9课时 | 1.7万人学习

尚观Linux RHCE视频教程(二)
尚观Linux RHCE视频教程(二)

共34课时 | 6.6万人学习

尚观RHCE视频教程(一)
尚观RHCE视频教程(一)

共28课时 | 5.5万人学习