如果你了解HTML,CSS和JavaScript,您已经拥有所需的工具开发Android应用程序。本动手本书展示了如何使用这些开源web标准设计和建造,可适应任何Android设备的应用程序 - 无需使用Java。您将学习如何创建一个在您选择的平台的Android友好的网络应用程序,然后转换与自由PhoneGap框架到一个原生的Android应用程序。了解为什么设备无关的移动应用是未来的潮流,并开始构建应用程序,提供更
html2text最稳,不依赖浏览器、支持批量处理且参数可控;需加-b 0禁换行、-g启github模式、--unicode-snob保中文标点,批量命令为for f in *.html; do html2text -b 0 -g --unicode-snob "$f" > "${f%.html}.md"; done。

用 html2text 转 HTML 为 Markdown 最稳当
直接装 html2text,它专为这个场景设计,不依赖浏览器、不执行 JS、不引入重量级依赖,比 BeautifulSoup + 手动解析快得多,也比 markdownify 更贴近真实写作习惯(比如保留缩进、处理嵌套列表更自然)。
安装和基础用法很简单:
pip install html2text
html2text 默认会把链接转成 [text](url) 格式,表格转成管道语法,代码块加围栏。但要注意几个关键参数:
-
ignore_links=False(默认)保留链接;设为True就只留文字 -
body_width=0关键!否则长段落会被自动折行,破坏 Markdown 可读性 -
single_line_break=True会让换行符变成单个\n,适合后续人工润色;默认是双换行,可能多出空行 - 如果 HTML 含内联样式或
script/style标签,先用BeautifulSoup预清理再喂给html2text,否则可能生成冗余空行或乱码
提取纯文本优先用 get_text(),别硬套 Markdown 工具
如果你只要干净文字(比如喂给 LLM、做日志分析),BeautifulSoup 的 get_text() 是最轻量、最可控的选择。它不关心结构转换,只做语义剥离。
常见误区是拿 html2text 转完再删 Markdown 符号——既慢又容易漏掉隐藏字符(比如零宽空格、 )。
实操建议:
- 用
strip=True去首尾空白 -
separator=' '把块级元素间空行换成单空格,避免段落粘连 - 加
types=(bs4.element.NavigableString,)可跳过注释、CDATA 等干扰节点 - 遇到
<br>或<p></p>导致的多余换行,用正则后处理比改解析逻辑更可靠:re.sub(r'\n\s*\n', '\n\n', text)
markdownify 适合需要保留复杂 HTML 结构的场景
当源 HTML 大量使用自定义 class、嵌套 div、或依赖 CSS 生成内容(如伪元素)时,html2text 会丢信息。markdownify 支持通过 convert_tag 注册自定义转换器,能映射 class 到特定 Markdown 语法(比如把 class="warning" 转成 !!! warning)。
但它有两个硬伤:
- 默认把所有块级标签当段落处理,导致无序列表前多出空行
- 对
colspan/rowspan表格支持弱,容易崩格式 - 不兼容 Python 3.12+ 的某些 AST 变更(报
AttributeError: 'Constant' object has no attribute 's'),得锁版本到markdownify==0.11.6
批量处理要防编码错乱和路径陷阱
读文件时别直接用 open(path).read()——HTML 文件常见 gbk、gb2312 编码,Python 默认按 UTF-8 解,必然报 UnicodeDecodeError。
稳妥做法是用 chardet 检测后再读:
import chardet<br>with open(path, 'rb') as f:<br> raw = f.read()<br> enc = chardet.detect(raw)['encoding'] or 'utf-8'<br> html = raw.decode(enc)
还有两个易忽略点:
- 相对路径资源(如
<img src="images/a.png">)在转换中不会被处理,但如果你后续要渲染,得自己补前缀或转为 base64 - Windows 下路径含中文时,
pathlib.Path比字符串拼接更安全,尤其配合glob批量找文件
真正难的不是转换本身,是判断哪部分 HTML 该留、哪部分该砍——比如广告 div、页脚版权、动态加载的评论区。这类逻辑没法靠通用库解决,得结合具体 DOM 结构写过滤规则。
Python免费学习笔记(深入):立即使用
在学习笔记中,你将探索 Python 的核心概念和高级技巧!










