
本文介绍如何将无序的标题字符串列表(含数字编号与非编号项)自动解析为逻辑嵌套的树状结构,通过两阶段处理识别父子关系,最终输出可读性强的层级化数据。
本文介绍如何将无序的标题字符串列表(含数字编号与非编号项)自动解析为逻辑嵌套的树状结构,通过两阶段处理识别父子关系,最终输出可读性强的层级化数据。
在文档解析、目录生成或知识图谱构建等场景中,常需将线性标题列表转化为具有明确父子关系的树形结构。本方案不依赖外部库(如 anytree),仅用标准 Python 实现,核心思想是利用编号前缀的层级语义(如 "13.3.1" 是 "13.3" 的子项),并合理归并后续无编号标题作为最近编号项的叶子节点。
一、关键规则与前提假设
- 编号标题:以数字和点号开头(如 "13.3. Risk"),其编号部分(如 "13.3")定义层级路径;
- 非编号标题(如 "SubStrategy"):默认归属于前一个最近的、编号层级更浅的父标题;
- 层级判定:编号 "A.B.C" 的直接父级为 "A.B";若 "A.B" 不存在,则向上截取 "A",依此类推;
- 所有标题均为字符串,无嵌套格式干扰。
二、两阶段构建法(清晰可维护)
✅ 第一阶段:提取编号节点并挂载直属非编号子项
遍历原始列表,分离编号项与非编号项,建立初步映射:
import json
titles = [
"13.3. Risk",
"13.3.1. Strategy",
"SubStrategy",
"13.3.2. Token",
"Material",
"Impact",
"Aling"
]
# 阶段一:构建编号节点字典 {key: {"name": full_title, "children": [...]}}
results = {}
current_parent = None
for title in titles:
if title and title[0].isnumeric():
# 提取编号前缀(去除末尾点号)
prefix = title.split(" ", 1)[0].rstrip(".")
# 创建或获取该编号节点
node = results.setdefault(prefix, {"name": title, "children": []})
current_parent = node # 记录最新编号父节点
elif current_parent is not None:
# 非编号项 → 挂载到当前父节点的 children 列表
current_parent["children"].append(title)
# 此时 results 包含所有编号节点及其直属非编号子项
✅ 第二阶段:按编号前缀建立父子树链
基于编号的层级关系(如 "13.3.1" 的父级是 "13.3"),递归组装完整树:
# 阶段二:按编号层级关联父子节点
roots = []
for key, node in results.items():
# 截取上一级编号(如 "13.3.1" → "13.3")
parent_key = ".".join(key.split(".")[:-1])
# 若父编号存在,则将当前节点加入其 children;否则视为根节点
if parent_key in results:
results[parent_key]["children"].append(node)
else:
roots.append(node)
# 输出结构化树(支持 JSON 序列化)
print("最终层级结构:")
for i, root in enumerate(roots):
print(f"\nRoot {i+1}:")
print(json.dumps(root, indent=2, ensure_ascii=False))
运行后输出符合预期的嵌套结构:
Root 1:
{
"name": "13.3. Risk",
"children": [
{
"name": "13.3.1. Strategy",
"children": ["SubStrategy"]
},
{
"name": "13.3.2. Token",
"children": ["Material", "Impact", "Aling"]
}
]
}
三、注意事项与增强建议
- 健壮性:实际使用中建议添加异常处理(如空字符串、非法编号格式);
- 多根支持:当前逻辑天然支持多个顶层编号(如 "1.", "2." 并存),自动识别为独立根节点;
- 可视化扩展:可结合 anytree 或自定义递归函数生成带缩进的文本树(如问题中所示 |_ 格式);
- 性能优化:大数据量时可将 results 改为 dict + sorted keys 一次遍历完成关联。
此方法逻辑清晰、易于调试,无需正则复杂匹配,也避免了第三方库的依赖负担,是构建轻量级文档结构化解析器的理想起点。











