如何编写一个健壮的 Markdown 解析器:正则的基础应用

阿涛吖_9668

阿涛吖_9668

2026-06-13

996人浏览

原创

正则适合作为markdown解析器的行级初筛工具,适合匹配标题、水平线等独立成行的块元素,但无法处理嵌套、内联格式、多行引用等需状态跟踪的场景。

如何编写一个健壮的 markdown 解析器:正则的基础应用

正则表达式可以作为 Markdown 解析器的起点,但仅靠正则很难做到真正健壮。它适合处理结构清晰、边界明确的块级元素(如标题、水平线),对嵌套、交叉、上下文敏感的语法(如内联强调、链接中的括号、代码块内的井号)容易出错。想用正则打基础,关键不是“全靠它”,而是清楚它的能力边界,并在合适位置用它做快速初筛。

哪些场景适合用正则快速切入

正则最稳妥的用武之地是识别**独立成行、格式固定、无嵌套干扰**的 Markdown 块:

  • 标题:用 /^#{1,6}\s+(.+)$/ 匹配一行开头的 1–6 个 # 号加空格,提取内容和层级
  • 水平线:用 /^(?:-{3,}|_{3,}|\*{3,})\s*$/ 匹配连续三个以上的 -、_ 或 *(忽略末尾空格)
  • 引用块起始:用 /^>\s+(.+)$/ 匹配以 > 开头的单行引用(注意:多行引用需状态跟踪,正则不适用)
  • 无序列表项:用 /^[-*+]\s+(.+)$/ 匹配以 -、* 或 + 开头的单行列表(同样,缩进续行需额外逻辑)

哪些地方正则会“翻车”,必须绕开

以下常见 Markdown 结构,若强行用正则处理,极易产生误匹配或漏匹配:

Markdown to PDF (Styled)
Markdown to PDF (Styled)

使用pandoc和wkhtmltopdf将Markdown文件转换为带样式的PDF,支持内置或自定义CSS样式。

下载
  • 内联格式:比如 *斜体* 和 **粗体** 混在一起时,<code>/\*\*(.*?)\*\*/ 会因贪婪匹配跨过中间的 *,把 **a*b** 错解析为粗体“a*b”而非“a”加斜体“b”
  • 代码块与普通文本混排:反引号包裹的 `inline code` 可能出现在任何位置,而段落里又可能有孤立的 ` 符号,正则难以区分上下文
  • 链接和图片:[文字](url) 中的 url 可能含括号,如 [官网](https://example.com/path?x=1&y=2),简单正则无法正确截断
  • 缩进式代码块:依赖行首空格数量和前后空行判断,纯正则无法维护“上一行是否为空行”这类状态

正则如何作为健壮解析器的第一步

把正则当作“分词预处理”工具,而不是最终渲染引擎:

  • 先按换行符 .split('\n') 把原文拆成行数组
  • 对每一行,用一组带优先级的正则依次尝试匹配:先试标题,再试水平线,再试列表……匹配成功就打上对应类型标签(如 { type: 'heading', level: 2, text: '内容' }),未匹配的行暂标为 'paragraph'
  • 得到带类型的行序列后,再进入第二阶段:合并连续的 paragraph 行、将同级列表项聚合成 list 节点、处理引用块的多行延续——这些都需要状态机或递归下降,不能只靠正则
  • 最后,把结构化的节点树交给专门的渲染器转成 HTML,此时内联部分再用更安全的逐字符扫描或有限状态机处理

一个实际可用的正则预处理示例

下面这段 JavaScript 代码只做行级分类,不负责渲染,也不处理嵌套:

function tokenizeLines(md) {
  return md.split('\n').map(line => {
    const heading = line.match(/^#{1,6}\s+(.+)$/);
    if (heading) return { type: 'heading', level: heading[0].indexOf(' ') , text: heading[1] };
<pre class="brush:php;toolbar:false;">const hr = line.match(/^(?:-{3,}|_{3,}|\*{3,})\s*$/);
if (hr) return { type: 'hr' };

const blockquote = line.match(/^>\s+(.+)$/);
if (blockquote) return { type: 'blockquote', text: blockquote[1] };

const list = line.match(/^[-*+]\s+(.+)$/);
if (list) return { type: 'list_item', text: list[1] };

return { type: 'paragraph', text: line.trim() };

}); }

相关文章

PHP速学视频免费教程(入门到精通)
PHP速学视频免费教程(入门到精通)

PHP怎么学习?PHP怎么入门?PHP在哪学?PHP怎么学才快?不用担心,这里为大家提供了PHP速学教程(入门到精通),有需要的小伙伴保存下载就能学习啦!

下载

相关标签:

正则表达式 markdown

本站声明:本文内容由网友自发贡献,版权归原作者所有,本站不承担相应法律责任。如您发现有涉嫌抄袭侵权的内容,请联系admin@php.cn

相关专题

更多
js正则表达式
js正则表达式

php中文网为大家提供各种js正则表达式语法大全以及各种js正则表达式使用的方法,还有更多js正则表达式的相关文章、相关下载、相关课程,供大家免费下载体验。

2023.06.20

4096

8

正则表达式不包含
正则表达式不包含

正则表达式,又称规则表达式,,是一种文本模式,包括普通字符和特殊字符,是计算机科学的一个概念。正则表达式使用单个字符串来描述、匹配一系列匹配某个句法规则的字符串,通常被用来检索、替换那些符合某个模式的文本。php中文网给大家带来了有关正则表达式的相关教程以及文章,希望对大家能有所帮助。

2023.07.05

2621

4

java正则表达式语法
java正则表达式语法

java正则表达式语法是一种模式匹配工具,它非常有用,可以在处理文本和字符串时快速地查找、替换、验证和提取特定的模式和数据。本专题提供java正则表达式语法的相关文章、下载和专题,供大家免费下载体验。

2023.07.05

7162

9

java正则表达式匹配字符串
java正则表达式匹配字符串

在Java中,我们可以使用正则表达式来匹配字符串。本专题为大家带来java正则表达式匹配字符串的相关内容,帮助大家解决问题。

2023.08.11

792

5

正则表达式空格
正则表达式空格

正则表达式空格可以用“\s”来表示,它是一个特殊的元字符,用于匹配任意空白字符,包括空格、制表符、换行符等。本专题为大家提供正则表达式相关的文章、下载、课程内容,供大家免费下载体验。

2023.08.31

500

5

Python爬虫获取数据的方法
Python爬虫获取数据的方法

Python爬虫可以通过请求库发送HTTP请求、解析库解析HTML、正则表达式提取数据,或使用数据抓取框架来获取数据。更多关于Python爬虫相关知识。详情阅读本专题下面的文章。php中文网欢迎大家前来学习。

2023.11.13

653

12

正则表达式空格如何表示
正则表达式空格如何表示

正则表达式空格可以用“\s”来表示,它是一个特殊的元字符,用于匹配任意空白字符,包括空格、制表符、换行符等。想了解更多正则表达式空格怎么表示的内容,可以访问下面的文章。

2023.11.17

386

3

正则表达式中如何匹配数字
正则表达式中如何匹配数字

正则表达式中可以通过匹配单个数字、匹配多个数字、匹配固定长度的数字、匹配整数和小数、匹配负数和匹配科学计数法表示的数字的方法匹配数字。更多关于正则表达式的相关知识详情请看本专题下面的文章。php中文网欢迎大家前来学习。

2023.12.06

719

7

php正则表达式有哪些
php正则表达式有哪些

php正则表达式有"/pattern/"、"^"、"$"、"."、"[]"、"[^]"、"[a-z]"、"[A-Z]"、"[0-9]"、"\d"、"\D"、"\w"、"\W"、&a

2024.02.23

312

5

热门下载

更多
网站特效
/
网站源码
/
网站素材
/
前端模板

精品课程

更多
相关推荐
/
热门推荐
/
最新课程
WEB前端教程【HTML5+CSS3+JS】
WEB前端教程【HTML5+CSS3+JS】

共101课时 | 20.9万人学习

JavaScript正则表达式基础与实战
JavaScript正则表达式基础与实战

共11课时 | 1.7万人学习

布尔教育正则表达式视频教程
布尔教育正则表达式视频教程

共14课时 | 5.1万人学习