如何解决 BeautifulSoup 网页抓取返回空文本的问题?

阿伟姑娘_6834

阿伟姑娘_6834

2026-07-01

187人浏览

原创

如何解决 BeautifulSoup 网页抓取返回空文本的问题?

本文详解为何 beautifulsoup 抓取网页时返回空文本,并指出关键原因:未正确处理重定向(http 301/302),导致获取到的是跳转响应而非目标页面 html 内容。

本文详解为何 beautifulsoup 抓取网页时返回空文本,并指出关键原因:未正确处理重定向(http 301/302),导致获取到的是跳转响应而非目标页面 html 内容。

在使用 requests + BeautifulSoup 进行网页抓取时,看似相同的代码在不同网站上表现不一致,往往源于一个被忽视的底层 HTTP 行为——重定向(Redirect)。你提供的代码中设置了 allow_redirects=False,这会导致 requests.get() 在遇到 301 或 302 响应时立即停止并返回跳转响应本身(通常不含 HTML 主体内容),而非自动跟进至最终目标页面。因此,response.content 实际是空或仅含重定向头信息,BeautifulSoup 解析后自然无法提取有效文本。

以目标网址 https://www.diabete.qc.ca/en/... 为例,该站点实际会将请求重定向至带尾部斜杠的规范 URL(如 .../female-sexuality-and-diabetes/ → .../female-sexuality-and-diabetes/ 可能触发内部路径标准化或 CDN 路由),若禁用重定向,response.status_code 很可能为 301 或 302,而 response.content 几乎为空——这正是 soup.get_text() 返回空字符串的根本原因。

✅ 正确做法是启用重定向(默认即为 True),并优化基础代码:

Detect GPT
Detect GPT

Detect GPT是一款用于浏览网页时识别 AI 生成内容的 Chrome 扩展和文本检测工具。

下载
import requests
from bs4 import BeautifulSoup

current_url = "https://www.diabete.qc.ca/en/understand-diabetes/all-about-diabetes/complications/female-sexuality-and-diabetes/"

try:
    # ✅ 允许重定向(关键修复),移除不必要的 verify=False(生产环境应验证证书)
    response = requests.get(
        current_url,
        headers={'User-Agent': 'Mozilla/5.0 (Windows NT 10.0; Win64; x64) AppleWebKit/537.36'}
    )
    response.raise_for_status()  # 检查 HTTP 错误状态码(如 404、500)

    soup = BeautifulSoup(response.content, 'html.parser')  # 直接传 bytes,避免手动 decode/encode
    text = soup.get_text(" ", strip=True)
    print(f"成功提取 {len(text)} 字符文本")
    print(text[:200] + "...")  # 预览前 200 字符

except requests.exceptions.RequestException as e:
    print(f"请求失败:{e}")

? 关键注意事项:

  • allow_redirects=True 是默认行为,显式写出更清晰;禁用它仅适用于需手动控制跳转逻辑的特殊场景。
  • response.content 是原始字节流,直接传给 BeautifulSoup(配合 html.parser)比先 decode() 再 strip_accents() 更安全可靠——后者易引发编码异常,且现代网页多为 UTF-8,无需额外去重音处理。
  • 始终调用 response.raise_for_status() 检查网络错误或服务端异常,避免静默失败。
  • verify=False 会禁用 SSL 证书验证,存在安全风险,仅限调试;生产环境请确保系统证书可信或指定 cert= 参数。

总结:当 BeautifulSoup 返回空结果时,首要排查 response.status_code 是否为 200,并确认 response.content 是否包含有效 HTML —— 这比调试解析逻辑更能快速定位问题根源。重定向配置,是新手最容易忽略却影响最大的基础设置。

相关文章

PHP速学视频免费教程(入门到精通)
PHP速学视频免费教程(入门到精通)

PHP怎么学习?PHP怎么入门?PHP在哪学?PHP怎么学才快?不用担心,这里为大家提供了PHP速学教程(入门到精通),有需要的小伙伴保存下载就能学习啦!

下载

相关标签:

本站声明:本文内容由网友自发贡献,版权归原作者所有,本站不承担相应法律责任。如您发现有涉嫌抄袭侵权的内容,请联系admin@php.cn

相关专题

更多
html版权符号
html版权符号

html版权符号是“©”,可以在html源文件中直接输入或者从word中复制粘贴过来,php中文网还为大家带来html的相关下载资源、相关课程以及相关文章等内容,供大家免费下载使用。

2023.06.14

5415

7

html在线编辑器
html在线编辑器

html在线编辑器是用于在线编辑的工具,编辑的内容是基于HTML的文档。它经常被应用于留言板留言、论坛发贴、Blog编写日志或等需要用户输入普通HTML的地方,是Web应用的常用模块之一。php中文网为大家带来了html在线编辑器的相关教程、以及相关文章等内容,供大家免费下载使用。

2023.06.21

3112

4

html网页制作
html网页制作

html网页制作是指使用超文本标记语言来设计和创建网页的过程,html是一种标记语言,它使用标记来描述文档结构和语义,并定义了网页中的各种元素和内容的呈现方式。本专题为大家提供html网页制作的相关的文章、下载、课程内容,供大家免费下载体验。

2023.07.31

2770

5

html空格
html空格

html空格是一种用于在网页中添加间隔和对齐文本的特殊字符,被用于在网页中插入额外的空间,以改变元素之间的排列和对齐方式。本专题为大家提供html空格的相关的文章、下载、课程内容,供大家免费下载体验。

2023.08.01

2799

5

html是什么
html是什么

HTML是一种标准标记语言,用于创建和呈现网页的结构和内容,是互联网发展的基石,为网页开发提供了丰富的功能和灵活性。本专题为大家提供html相关的各种文章、以及下载和课程。

2023.08.11

4679

6

html字体大小怎么设置
html字体大小怎么设置

在网页设计中,字体大小的选择是至关重要的。合理的字体大小不仅可以提升网页的可读性,还能够影响用户对网页整体布局的感知。php中文网将介绍一些常用的方法和技巧,帮助您在HTML中设置合适的字体大小。

2023.08.11

2761

3

html转txt
html转txt

html转txt的方法有使用文本编辑器、使用在线转换工具和使用Python编程。本专题为大家提供html转txt相关的文章、下载、课程内容,供大家免费下载体验。

2023.08.31

2549

3

html文本框代码怎么写
html文本框代码怎么写

html文本框代码:1、单行文本框【<input type="text" style="height:..;width:..;" />】;2、多行文本框【textarea style=";height:;"></textare】。

2023.09.01

2288

6

HTML嵌入CSS样式的方法
HTML嵌入CSS样式的方法

HTML嵌入CSS样式的方法有内联样式、内部样式表和外部样式表。本专题为大家提供CSS样式相关的文章、下载、课程内容,供大家免费下载体验。

2023.09.20

2308

5

热门下载

更多
网站特效
/
网站源码
/
网站素材
/
前端模板

精品课程

更多
热门推荐
/
最新课程
phpStudy极速入门视频教程
phpStudy极速入门视频教程

共6课时 | 54.6万人学习

独孤九贱(4)_PHP视频教程
独孤九贱(4)_PHP视频教程

共89课时 | 133.4万人学习