
本文详解 Selenium 爬虫中因分页元素包含非数字文本(如“Go back a page”、省略号“…”或空字符串)导致 int() 转换失败的典型错误,并提供健壮、可复用的页码提取方案。
本文详解 selenium 爬虫中因分页元素包含非数字文本(如“go back a page”、省略号“…”或空字符串)导致 `int()` 转换失败的典型错误,并提供健壮、可复用的页码提取方案。
在使用 Selenium 进行分页爬取时,一个常见陷阱是直接对分页
Page 1 text='Go back a page' ← 非数字,int() 报错
Page 4 text='' ← 空字符串,int('') 报 ValueError
Page 5 text='' ← 实际链接含数字但 text 为空(因文本在子标签内)
根本原因在于:.text 属性仅返回可见且渲染后的纯文本内容,而 Audible 分页中部分数字实际嵌套在 标签内,其父
✅ 正确做法:过滤 + 容错 + 回退定位
推荐采用三层保障策略提取有效页码:
1. 优先从 标签中提取数字(最可靠)
# ✅ 改进:精准定位所有页码链接(而非 li 列表项)
pages = WebDriverWait(pagination, 20).until(
EC.presence_of_all_elements_located((By.CSS_SELECTOR, 'a.pageNumberElement'))
)
page_numbers = []
for page_elem in pages:
text = page_elem.text.strip()
if text.isdigit():
page_numbers.append(int(text))
last_page = max(page_numbers) if page_numbers else 1
2. 若 text 为空,尝试从 href 中解析(兜底方案)
当 .text 返回空但 href 包含 ?page=5 时,可用正则提取:
import re
page_numbers = []
for page_elem in pages:
# 先试 text
text = page_elem.text.strip()
if text.isdigit():
page_numbers.append(int(text))
else:
# 再试 href
href = page_elem.get_attribute("href") or ""
match = re.search(r"[?&]page=(\d+)", href)
if match:
page_numbers.append(int(match.group(1)))
last_page = max(page_numbers) if page_numbers else 1
3. 增加健壮性:避免索引越界与空列表异常
始终检查列表长度,并设置默认值(如 last_page = 1)防止逻辑中断:
if not page_numbers:
print("⚠️ Warning: No valid page numbers found. Defaulting to 1.")
last_page = 1
else:
last_page = max(page_numbers)
print(f"Detected total pages: {last_page}")
⚠️ 关键注意事项
- 勿依赖固定索引(如 pages[-2]):分页 DOM 结构易变(首页/末页按钮位置、省略号增减),硬编码索引极易失效。
- 避免 implicitly_wait 混用:在显式等待(WebDriverWait)后混用 driver.implicitly_wait() 会干扰超时逻辑,建议全程使用显式等待。
- 分页跳转需等待新内容加载:点击“Next”后,务必等待目标容器(如 adbl-impression-container)刷新,否则会重复抓取旧页数据:
next_button = driver.find_element(By.XPATH, '//span[contains(@class,"nextButton")]')
next_button.click()
# ✅ 等待新页内容加载完成
WebDriverWait(driver, 10).until(
EC.staleness_of(products[0]) # 确保旧 product 元素已失效
)
WebDriverWait(driver, 10).until(
EC.presence_of_element_located((By.CLASS_NAME, "adbl-impression-container"))
)
通过以上方法,即可彻底规避 ValueError: invalid literal for int() 错误,构建稳定、可维护的分页爬虫逻辑。核心原则是:永远假设网页内容不可信,对所有外部输入做类型校验与异常捕获。










