如何正确从 Wikisource 页面提取书籍正文文本(以《高老头》为例)

小杰君_6410

小杰君_6410

2026-09-19

779人浏览

原创

如何正确从 Wikisource 页面提取书籍正文文本(以《高老头》为例)

本文详解为何使用 mw-parser-output 类无法提取 Wikisource 书籍正文,并提供两种可靠方案:一是精准定位 prp-pages-output 容器直接获取全文;二是通过 CSS 选择器跳过元信息,仅提取纯书籍内容。

本文详解为何使用 `mw-parser-output` 类无法提取 wikisource 书籍正文,并提供两种可靠方案:一是精准定位 `prp-pages-output` 容器直接获取全文;二是通过 css 选择器跳过元信息,仅提取纯书籍内容。

Wikisource 的 HTML 结构具有高度定制性,其页面并非简单线性排布,而是嵌套多层语义化容器。初学者常误用通用 MediaWiki 类名(如 mw-parser-output)定位正文,但该类在页面中重复出现两次:第一次出现在页首元数据区域(含作者、版本说明、导航链接等),第二次才包裹真正的书籍内容。而 soup.find() 默认返回首个匹配元素,导致提取结果为空或混入无关信息。

✅ 推荐方案一:直取 prp-pages-output 容器(简洁可靠)

Wikisource 为书籍正文专门设置了语义化类名 prp-pages-output(Page Rendering Plugin),它唯一且稳定地包裹全部章节文本。无需遍历子标签,调用 .get_text() 即可安全提取:

import requests
from bs4 import BeautifulSoup

def extract_text_simple(url):
    try:
        response = requests.get(url, timeout=10)
        response.raise_for_status()
        soup = BeautifulSoup(response.text, 'html.parser')

        # 精准定位书籍正文容器(唯一且语义明确)
        text_section = soup.find("div", class_="prp-pages-output")
        if not text_section:
            raise ValueError("❌ 未找到 'prp-pages-output' 容器,请确认 URL 是否有效或页面结构是否变更")

        # 一键提取所有可见文本,自动处理换行与空白
        return text_section.get_text(strip=True)

    except requests.RequestException as e:
        print(f"⚠️ 网络请求失败: {e}")
        return None
    except Exception as e:
        print(f"❌ 解析异常: {e}")
        return None

# 示例调用
url = "https://fr.wikisource.org/wiki/Le_P%C3%A8re_Goriot_(1855)"
text = extract_text_simple(url)
print(f"✅ 成功提取 {len(text)} 字符\n{text[:200]}...")

优势:代码简短、鲁棒性强、兼容多数 Wikisource 书籍页(法、英、中等语言站均采用此约定类名)。

✅ 推荐方案二:CSS 选择器精准过滤(纯正文专用)

若需严格排除页眉、页脚、导航栏等非正文内容(例如只保留小说章节段落),可利用 Wikisource 的结构特征:正文段落均位于 <div itemid> 元素之后的兄弟节点中。以下选择器 <code>div.prp-pages-output > div[itemid] ~ * 表示:

  • prp-pages-output 容器内;
  • 找到首个带 itemid 属性的 div(即章节起始标记);
  • 选取其后所有同级兄弟元素(~ *)——即真正的小说段落。
def extract_text_pure(url):
    try:
        response = requests.get(url, timeout=10)
        response.raise_for_status()
        soup = BeautifulSoup(response.text, 'html.parser')

        # 定位正文段落:跳过元信息,只取章节内容
        text_elements = soup.select("div.prp-pages-output > div[itemid] ~ *")
        if not text_elements:
            raise ValueError("⚠️ 未检测到章节内容,请检查页面是否含 'div[itemid]' 标记")

        # 清洗并拼接(保留段落分隔)
        lines = [elem.get_text(strip=True) for elem in text_elements]
        return "\n".join(line for line in lines if line)  # 过滤空行

    except Exception as e:
        print(f"❌ 提取失败: {e}")
        return None

# 使用示例
text_pure = extract_text_pure(url)
print(f"? 纯正文共 {len(text_pure)} 字符(不含元数据)")

⚠️ 关键注意事项

  • User-Agent 必须设置:Wikisource 可能拒绝默认 requests UA 请求。建议添加头部:
    headers = {"User-Agent": "Mozilla/5.0 (Windows NT 10.0; Win64; x64) AppleWebKit/537.36"}
    response = requests.get(url, headers=headers, timeout=10)
  • 编码与语言适配:法文页面含 UTF-8 特殊字符,response.text 已自动解码,无需手动 response.content.decode()
  • 反爬与频率控制:批量抓取时务必遵守 robots.txt(如 https://fr.wikisource.org/robots.txt),添加 time.sleep(1) 避免被限流。
  • 结构变动预警:Wikisource 插件更新可能导致 prp-pages-output 类名变更。生产环境建议增加 fallback 逻辑(如回退至 mw-parser-output 的第二个匹配项)。

通过以上任一方案,您均可稳定、高效地从 Wikisource 提取高质量书籍文本,为后续 NLP 分析、文本存档或电子书生成奠定坚实基础。

PHP速学视频免费教程(入门到精通)
PHP速学视频免费教程(入门到精通)

PHP怎么学习?PHP怎么入门?PHP在哪学?PHP怎么学才快?不用担心,这里为大家提供了PHP速学教程(入门到精通),有需要的小伙伴保存下载就能学习啦!

下载

相关标签:

本站声明:本文内容由网友自发贡献,版权归原作者所有,本站不承担相应法律责任。如您发现有涉嫌抄袭侵权的内容,请联系admin@php.cn

相关专题

更多
免费爬虫工具有哪些
免费爬虫工具有哪些

免费爬虫工具有Scrapy、Beautiful Soup、ParseHub、Octoparse、Webocton Scriptly、RoboBrowser和Goutte。更多关于免费爬虫工具的问题,详情请看本专题下面的文章。php中文网欢迎大家前来学习。

2023.11.10

3933

9

Python爬虫获取数据的方法
Python爬虫获取数据的方法

Python爬虫可以通过请求库发送HTTP请求、解析库解析HTML、正则表达式提取数据,或使用数据抓取框架来获取数据。更多关于Python爬虫相关知识。详情阅读本专题下面的文章。php中文网欢迎大家前来学习。

2023.11.13

653

12

AI视频生成软件推荐
AI视频生成软件推荐

本专题汇总了当前主流的AI视频生成软件推荐与排行榜单,涵盖seko、AniShort、剧云、Lovart、LiblibAI及立刻mv等热门工具。同时整理了各软件在文生视频、图生视频、时长限制、画质表现及免费额度等方面的差异对比,助您快速选对适合创作需求的AI视频生成工具。

2026.09.16

140

9

ai生成视频的工具免费版合集
ai生成视频的工具免费版合集

本专题汇总了当前免费AI生成视频工具的排行榜与推荐清单,涵盖seko、讯飞智作、AniShort及剧云、Lovart等多模型集成平台。同时整理了各工具的免费额度、输出时长、水印政策及适用场景差异,助您快速选择合适工具开启AI视频创作。

2026.09.16

60

10

Pandas时间序列分析与可视化报表
Pandas时间序列分析与可视化报表

本专题整理Pandas日期转换、时间索引、重采样、滚动窗口、时区处理、plot绘图、Styler表格样式和报表输出方法。

2026.09.16

60

23

Pandas数据筛选索引与清洗处理
Pandas数据筛选索引与清洗处理

本专题整理Pandas中的loc、iloc、条件筛选、query查询、缺失值处理、重复值删除、类型转换和字符串列清洗方法。

2026.09.16

40

25

Pandas数据读取导入与文件导出处理
Pandas数据读取导入与文件导出处理

本专题整理Pandas读取CSV、Excel、JSON、SQL、Parquet等文件的方法,以及to_csv、to_excel、to_sql和to_parquet等常用数据导出流程。

2026.09.16

40

27

GDB怎么设置断点
GDB怎么设置断点

本专题介绍GDB按照函数名、源代码行号和文件位置设置断点的方法,详细说明run、continue、next、step等命令的配合使用,帮助定位程序崩溃、逻辑异常及代码未按预期执行的问题。

2026.09.11

360

28

GDB怎么查看变量值
GDB怎么查看变量值

本专题介绍GDB调试过程中查看变量值的具体方法,涵盖局部变量、函数参数、数组、结构体和指针内容查询,同时整理变量持续显示、格式化输出及无法读取变量时的排查思路。

2026.09.11

120

22

热门下载

更多
网站特效
/
网站源码
/
网站素材
/
前端模板

精品课程

更多
热门推荐
/
最新课程
phpStudy极速入门视频教程
phpStudy极速入门视频教程

共6课时 | 54.6万人学习

独孤九贱(4)_PHP视频教程
独孤九贱(4)_PHP视频教程

共89课时 | 133万人学习