
本文介绍如何用 selenium 模拟浏览器行为,自动化点击“下一页”按钮,完整抓取巴西证券交易所(b3)clube de investimento 页面中 javascript 渲染的动态分页表格数据,并合并为结构化 dataframe。
本文介绍如何用 selenium 模拟浏览器行为,自动化点击“下一页”按钮,完整抓取巴西证券交易所(b3)clube de investimento 页面中 javascript 渲染的动态分页表格数据,并合并为结构化 dataframe。
在爬取类似 B3 官网(https://www.php.cn/link/0ccb9e1a760913793956893be07e664c)这类基于 ASP.NET WebForms 构建的网站时,常见痛点是:表格数据通过 AJAX 或服务端控件动态加载,且分页不改变 URL,传统 requests + BeautifulSoup 无法直接触发翻页逻辑。此时,单纯解析 HTML 源码只能获取第一页内容;而手动构造 POST 请求模拟分页则需逆向分析 ViewState、EventValidation 等隐藏字段,复杂度高、易失效。
更稳健的方案是采用浏览器自动化工具——Selenium,真实复现用户点击行为,等待 DOM 更新后提取数据。
✅ 核心实现步骤
-
启动浏览器并导航至目标页面
使用webdriver.Chrome()打开页面,确保 JavaScript 正常执行; -
显式等待关键元素就绪
例如先点击「Administradores」标签页(因数据实际位于该 Tab),再定位分页按钮; -
循环提取 + 点击下一页
每次调用pd.read_html(driver.page_source)[0]解析当前页表格(注意索引位置可能随页面结构变化,建议结合attrs={'id': '...'}更精准定位); -
异常处理保障鲁棒性
捕获TimeoutException(无下一页)、StaleElementReferenceException(DOM 刷新导致元素失效)等典型异常,避免中断流程; -
数据清洗与合并
合并所有页的 DataFrame,并过滤掉表头占位符行(如含...的伪数据行)。
? 完整可运行代码示例
from selenium import webdriver
from selenium.webdriver.common.by import By
from selenium.webdriver.support.ui import WebDriverWait
from selenium.webdriver.support import expected_conditions as EC
from selenium.common.exceptions import TimeoutException, StaleElementReferenceException
import pandas as pd
# 初始化 WebDriver(请确保 chromedriver 在 PATH 中,或指定 executable_path)
driver = webdriver.Chrome()
url = "https://www.php.cn/link/0ccb9e1a760913793956893be07e664c"
driver.get(url)
data_frames = []
try:
while True:
# 确保进入 Administradores 标签页(关键!数据在此 Tab 下)
WebDriverWait(driver, 30).until(
EC.element_to_be_clickable((By.CSS_SELECTOR, 'a[id="ctl00_contentPlaceHolderConteudo_tabIbovespa_TabAdmnistradores"]'))
).click()
# 提取当前页表格(read_html 默认返回列表,[0] 为首个 table)
tables = pd.read_html(driver.page_source, header=0, attrs={'id': 'ctl00_contentPlaceHolderConteudo_grdAtivo_ctl01'})
if not tables:
print("未检测到有效表格,跳过本页")
break
current_df = tables[0]
data_frames.append(current_df)
# 尝试点击「下一页」按钮(注意:ID 含动态控件层级,需精确匹配)
next_btn = WebDriverWait(driver, 15).until(
EC.element_to_be_clickable((By.CSS_SELECTOR, 'input[id="ctl00_contentPlaceHolderConteudo_grdAtivo_ctl01_ctl03_ctl01_ctl00_lnkNext"]'))
)
driver.execute_script("arguments[0].click();", next_btn) # 使用 JS 点击更可靠
except TimeoutException:
print("✅ 已到达最后一页,停止翻页")
except Exception as e:
print(f"⚠️ 未知错误: {e}")
finally:
driver.quit()
# 合并所有页数据
if data_frames:
full_df = pd.concat(data_frames, ignore_index=True)
# 清洗:移除表头/分页占位符行(Administrador 字段以 '...' 开头或结尾的均为无效行)
cleaned_df = full_df[
~full_df['Administrador'].str.startswith('...') &
~full_df['Administrador'].str.endswith('...')
].dropna(subset=['Clube de Investimento', 'Administrador']).reset_index(drop=True)
print(f"✅ 成功抓取 {len(cleaned_df)} 条有效记录")
print(cleaned_df.head())
else:
print("❌ 未提取到任何数据")
⚠️ 注意事项与优化建议
- 驱动兼容性:推荐使用 WebDriver Manager 自动管理 ChromeDriver 版本,避免手动下载;
-
反爬策略:B3 网站暂无强反爬,但建议添加
time.sleep(1)或随机延迟(random.uniform(1, 3))降低请求频率; -
定位稳定性:ASP.NET 生成的 ID 常含动态后缀(如
_ctl01),若页面更新导致 ID 变化,可改用更稳定的 CSS 选择器,例如:table[id*='grdAtivo'] tbody tr:not(:first-child)
- 内存与性能:海量分页(如数千页)时,建议逐页保存 CSV 或数据库写入,而非全量驻留内存;
- 替代方案探索:长期维护项目可调研 B3 是否提供官方 API(如 B3 Open Data),优先选用稳定接口。
通过上述 Selenium 方案,你不仅能稳定获取全部分页数据,还为后续处理动态渲染内容(如筛选、排序、导出)打下坚实基础。










