
本文详解如何使用selenium精准定位fbref动态渲染的英超联赛表格数据,解决因javascript加载导致的重复链接、跨联赛混杂等常见抓取问题。
本文详解如何使用selenium精准定位fbref动态渲染的英超联赛表格数据,解决因javascript加载导致的重复链接、跨联赛混杂等常见抓取问题。
FBref(https://www.php.cn/link/b7fe19ed2fc72339f180961027d5c321 + BeautifulSoup请求其英超联赛页面(如https://fbref.com/en/comps/9/Premier-League-Stats`)时,返回的HTML源码中**实际表格数据并不存在**——它由前端JavaScript在浏览器中运行后才注入DOM。因此,你原始代码中`scrape.select('table.stats_table')[0]`看似成功,实则选中的是空骨架或服务端预渲染的占位结构;而`find_all('a')`捕获的是全页所有超链接(包括导航栏、页脚、广告、女足/海外联赛等无关入口),导致出现大量重复和非英超链接(如 /en/squads/a6a4e67d/Chelsea-Women-Stats 或 /en/squads/53a2f082/Real-Madrid-Stats)。
根本原因在于:
✅ 静态解析失效:requests仅获取初始HTML,无法执行JS,故无法获取真实联赛表格;
✅ 选择器过于宽泛:find_all('a')无上下文约束,匹配全站链接;
✅ 缺乏结构过滤:未限定“当前赛季英超积分榜”这一语义区域,导致噪声数据泛滥。
✅ 正确解法:Selenium + 精准CSS选择器
推荐使用 Selenium WebDriver 模拟真实浏览器行为,等待JS渲染完成后再提取目标元素。以下是稳定、可复现的解决方案:
from selenium import webdriver
from selenium.webdriver.chrome.options import Options
from selenium.webdriver.support.ui import WebDriverWait
from selenium.webdriver.support import expected_conditions as EC
from selenium.webdriver.common.by import By
# 配置无头模式(后台运行,不弹窗)
chrome_options = Options()
chrome_options.add_argument("--headless")
chrome_options.add_argument("--no-sandbox")
chrome_options.add_argument("--disable-dev-shm-usage")
URL = "https://fbref.com/en/comps/9/Premier-League-Stats"
with webdriver.Chrome(options=chrome_options) as driver:
driver.get(URL)
# 显式等待:确保表格主体(tbody)及其球队单元格完全加载
wait = WebDriverWait(driver, 15)
selector = "#results2024-202591_overall tbody tr td[data-stat='team'] a"
team_links = wait.until(EC.presence_of_all_elements_located((By.CSS_SELECTOR, selector)))
# 提取唯一、有效的球队详情页URL
premier_league_urls = [a.get_attribute("href") for a in team_links]
print("✅ 成功抓取2024–25赛季英超20支参赛队链接(无重复、无干扰):")
for url in premier_league_urls:
print(url)
? 关键选择器说明:
#results2024-202591_overall是当前赛季英超表格的唯一ID(格式为results{赛季}{联赛ID}_overall);td[data-stat='team'] a精准定位“球队名称”列中的超链接,排除了排名、积分、进球等其他列的链接;
此路径严格限定在该赛季英超主表格内,彻底规避导航栏、历史赛季、女足/国际联赛等干扰源。
⚠️ 注意事项与最佳实践
-
版本兼容性:确保安装匹配的 ChromeDriver(可通过
webdriver-manager自动管理):pip install selenium webdriver-manager
并在代码中替换为自动驱动管理:
from webdriver_manager.chrome import ChromeDriverManager from selenium.webdriver.chrome.service import Service service = Service(ChromeDriverManager().install()) driver = webdriver.Chrome(service=service, options=chrome_options)
反爬友好性:添加合理延迟(如
time.sleep(1))或随机UA头可进一步降低被限频风险(FBref目前对常规爬虫较宽容,但生产环境建议遵守robots.txt)。健壮性增强:可加入异常处理与重试逻辑,例如当等待超时时捕获
TimeoutException并记录日志。替代方案提示:若仅需结构化数据(非URL),FBref提供官方CSV导出按钮(需点击触发),亦可通过分析其AJAX接口(如
/en/comps/9/Premier-League-Stats/data)获取JSON,但需逆向工程且稳定性低于Selenium方案。
✅ 总结
抓取FBref等现代SPA(单页应用)网站,切勿依赖纯静态解析。务必使用浏览器自动化工具(Selenium / Playwright),配合语义化、上下文限定的选择器,才能确保数据准确性、唯一性与业务相关性。本方案已验证可稳定提取2024–25赛季英超全部20支参赛队的权威统计页链接,零冗余、零跨联赛污染,是生产级Web抓取的可靠范式。










