
本文教你使用 BeautifulSoup 自动识别维基百科页面中的 章节标题,逐章抓取其后连续的 段落文本、内部链接及脚注引用,并汇总为结构清晰的 pandas DataFrame,适用于机器学习等长篇技术词条的批量解析。
本文教你使用 beautifulsoup 自动识别维基百科页面中的 `
` 章节标题,逐章抓取其后连续的 `
` 段落文本、内部链接及脚注引用,并汇总为结构清晰的 pandas dataframe,适用于机器学习等长篇技术词条的批量解析。
在网页爬虫实践中,精准提取“章节级”结构化内容(而非整页或随机段落)是常见难点。以 Wikipedia 机器学习词条 为例,其二级目录(
)下包含多个三级子章节(),每个子章节由一个标题(如 Artificial intelligence)及其后续若干
段落组成,直到下一个
或更高层级标题出现为止。本文提供一套健壮、可复用的解析逻辑,无需硬编码段落数量(如 [:3]),而是动态终止于下一章节起点。核心思路:基于 DOM 邻居关系动态截断
关键在于利用 BeautifulSoup 的 find_next_siblings() 方法——它返回当前节点之后所有同级兄弟节点(按 HTML 文档顺序),我们只需遍历这些兄弟节点,当遇到下一个
时立即停止本章采集,从而天然适配各章节段落数量不一的情况。完整实现代码(含注释)
import pandas as pd
from bs4 import BeautifulSoup
import requests
url = "https://www.php.cn/link/71d779e5d91a630bc0f3cfc3a6db1d93"
response = requests.get(url)
soup = BeautifulSoup(response.content, "html.parser")
data = []
# 遍历所有 <h3> 标签(即每个子章节标题)
for h3 in soup.select('h3'):
# 提取章节标题文本(维基百科中标题常包裹在 <span id="..."> 内)
title_span = h3.find('span', id=True)
chapter_title = title_span.text.strip() if title_span else h3.get_text(strip=True)
# 初始化本章数据字典
chapter_data = {
'chapter': chapter_title,
'text': '', # 合并所有段落文本
'links': [], # 收集所有 <a> 标签的 href
'cite_ref': [] # 收集所有脚注引用链接(id 以 'cite_ref' 开头的 </a><a>)
}
# 遍历该 <h3> 之后的所有同级兄弟节点
for sibling in h3.find_next_siblings():
if sibling.name == 'p':
# 累加段落纯文本(避免重复换行符)
chapter_data['text'] += ' ' + sibling.get_text(strip=True)
# 提取段落内所有超链接
chapter_data['links'].extend([a.get('href') for a in sibling.select('a[href]')])
# 提取段落内所有脚注锚点(形如 <a href="#cite_note-1">)
chapter_data['cite_ref'].extend([
a.get('href') for a in sibling.select('[id^=cite_ref] a[href]')
])
elif sibling.name in ['h3', 'h2']: # 遇到新章节或主章节,结束当前采集
break
data.append(chapter_data)
# 可选:按指定章节名提前终止(如题目要求止于 "Statistical Physics")
if chapter_title == 'Statistical Physics':
break
# 转为 DataFrame,自动处理列表长度不一致问题(pandas 会填充 NaN)
df = pd.DataFrame(data)
print(df[['chapter', 'text']].head()) # 查看前几行摘要</a>
</h3></a></span>
</h3>
关键注意事项与优化建议
-
标题提取容错性:维基百科
中标题通常位于 内,但部分页面可能无此结构。代码已添加 fallback(直接取 h3.get_text()),确保鲁棒性。
-
链接去重与清洗:示例未做去重,实际应用中建议对 links 字段使用 list(set(...)) 并过滤 None 或 # 锚点链接。
-
脚注识别精度:[id^=cite_ref] a 选择器匹配维基标准脚注格式(如 下的 ),若需更全面捕获,可扩展为 soup.select('sup a[href^="#cite_note"]')。
-
反爬与稳定性:生产环境务必添加 headers(模拟浏览器)、设置 time.sleep() 间隔,并检查 response.status_code == 200;维基百科也提供官方 API(MediaWiki API),对大规模采集更推荐。
-
DataFrame 列处理:links 和 cite_ref 为列表类型,若需展开为多行(如每链接一行),可用 df.explode(['links', 'cite_ref'])。
中标题通常位于 内,但部分页面可能无此结构。代码已添加 fallback(直接取 h3.get_text()),确保鲁棒性。
通过此方法,你不再需要手动计数段落或编写冗余循环——让 HTML 的语义结构(标题+后续段落)本身指导爬取逻辑,真正实现“所见即所得”的结构化解析。










