如何从 DataFrame 列中智能提取章节编号并映射到新列

陌辰小哥_1400

陌辰小哥_1400

2026-04-12

564人浏览

原创

如何从 DataFrame 列中智能提取章节编号并映射到新列

本文介绍一种基于正则匹配与上下文记忆的稳健方法,用于从 section_name 中提取结构化章节 ID(如 1.1、1.3.1),并将其填充至 section_id 列;对无编号条目(如 Synopsis)自动关联最近匹配的编号,空值保持不变。

本文介绍一种基于正则匹配与上下文记忆的稳健方法,用于从 `section_name` 中提取结构化章节 id(如 `1.1`、`1.3.1`),并将其填充至 `section_id` 列;对无编号条目(如 `synopsis`)自动关联最近匹配的编号,空值保持不变。

在处理结构化文档类数据(如测试用例、标准规范或 PDF 表格解析结果)时,常遇到 section_name 列混合了带编号标题(如 "1.2.Schema12")和纯内容标题(如 "Synopsis")的情况。目标是为每一行准确推断其所属的逻辑章节 ID,并填充至新列 section_id——这不仅是字符串切分问题,更涉及上下文语义映射。

核心思路分为两步:

  1. 正则识别编号前缀:使用 re.match(r'(\d+(?:\.\d+)*)(.*)', s) 精确捕获连续数字与点号组成的层级 ID(支持 1、1.1、1.3.1 等任意深度),剩余部分作为“语义标识符”存入映射字典;
  2. 模糊反向匹配:对不含编号的行(如 "Synopsis"),遍历已记录的语义标识符,检查当前名称是否为其子串(if name.strip() in known_semantic_key),从而实现语义归属。

以下为完整可运行代码(兼容空值、None 和空白字符串):

import pandas as pd
import numpy as np
import re

# 构造示例数据(含空值与 None)
data = {
    'section_name': [
        '1.Test Summary9',
        '1.1.Synopsis9',
        '1.2.Schema12',
        '1.3.1.Test Period  I - Screening13',
        '1.3.2.Period II - obes-Treatment 15',
        'Synopsis',
        'Test Period  I - Screening',
        None,
        ''
    ]
}
df = pd.DataFrame(data)

def extract_section_id(row, memo_dict):
    name = row['section_name']
    # 跳过 None 和纯空白
    if pd.isna(name) or str(name).strip() == '':
        return ''  # 或返回 np.nan,按需选择

    s = str(name).strip()
    # 步骤1:尝试匹配编号前缀(如 1.3.1)
    match = re.match(r'^(\d+(?:\.\d+)*)\.(.*)$', s)
    if match:
        sec_id, semantic_part = match.groups()
        # 记录该语义片段对应的 ID(用于后续匹配)
        memo_dict[semantic_part] = sec_id
        return sec_id
    else:
        # 步骤2:对无编号行,在历史语义片段中查找包含关系
        for semantic_key, sec_id in memo_dict.items():
            if s in semantic_key or semantic_key in s:
                return sec_id
    return ''  # 未匹配时返回空字符串

# 初始化记忆字典
section_map = {}
df['section_id'] = df.apply(lambda x: extract_section_id(x, section_map), axis=1)

print(df)

输出结果:

                         section_name section_id
0                      1.Test Summary9          1
1                        1.1.Synopsis9        1.1
2                         1.2.Schema12        1.2
3   1.3.1.Test Period  I - Screening13      1.3.1
4  1.3.2.Period II - obes-Treatment 15      1.3.2
5                             Synopsis        1.1
6           Test Period  I - Screening      1.3.1
7                                None           
8                                     

✅ 关键优势说明:

  • 鲁棒性高:显式处理 None、空字符串、前后空格;
  • 语义感知:通过 s in semantic_key 实现“Synopsis 属于 1.1.Synopsis9”的合理映射,而非简单前缀匹配;
  • 状态可维护:memo_dict 在 apply 过程中持续累积已知模式,天然支持多层级文档流;
  • 正则精准:^(\d+(?:\.\d+)*)\. 确保只匹配开头的合法编号 + 点号,避免误截 Schema12 中的 12。

⚠️ 注意事项:

  • 若存在歧义语义(如 "Summary" 同时出现在 1.Test Summary9 和 2.Summary Notes),建议增强匹配逻辑(例如改为 semantic_key.startswith(s) 或引入编辑距离);
  • 生产环境建议将函数封装为独立模块,并添加日志记录未匹配项以便人工校验;
  • 对超大 DataFrame,可改用 itertuples() 提升性能,但需注意 memo_dict 仍需跨行共享。

该方法平衡了准确性、可读性与工程实用性,适用于各类嵌套编号文档的结构化解析任务。

PHP速学视频免费教程(入门到精通)
PHP速学视频免费教程(入门到精通)

PHP怎么学习?PHP怎么入门?PHP在哪学?PHP怎么学才快?不用担心,这里为大家提供了PHP速学教程(入门到精通),有需要的小伙伴保存下载就能学习啦!

下载

相关标签:

本站声明:本文内容由网友自发贡献,版权归原作者所有,本站不承担相应法律责任。如您发现有涉嫌抄袭侵权的内容,请联系admin@php.cn

相关专题

更多
Python 时间序列分析与预测
Python 时间序列分析与预测

本专题专注讲解 Python 在时间序列数据处理与预测建模中的实战技巧,涵盖时间索引处理、周期性与趋势分解、平稳性检测、ARIMA/SARIMA 模型构建、预测误差评估,以及基于实际业务场景的时间序列项目实操,帮助学习者掌握从数据预处理到模型预测的完整时序分析能力。

2025.12.04

320

15

Python 数据清洗与预处理实战
Python 数据清洗与预处理实战

本专题系统讲解 Python 在数据清洗与预处理中的核心技术,包括使用 Pandas 进行缺失值处理、异常值检测、数据格式化、特征工程与数据转换,结合 NumPy 高效处理大规模数据。通过实战案例,帮助学习者掌握 如何处理混乱、不完整数据,为后续数据分析与机器学习模型训练打下坚实基础。

2026.01.31

232

21

Python数据分析与Pandas高级实战
Python数据分析与Pandas高级实战

本专题围绕 Python 数据分析展开,系统讲解 Pandas 的高级用法,包括数据清洗、透视表、时间序列分析以及多表合并与分组操作。通过实战案例,帮助开发者掌握高效处理与分析数据的方法,提高数据处理效率与分析能力。

2026.04.13

431

25

LLVM自定义Pass怎么写
LLVM自定义Pass怎么写

本专题聚焦LLVM自定义Pass开发,整理Pass类结构、run()方法、PreservedAnalyses、CMake构建、插件注册、-load-pass-plugin加载和测试用例编写流程。

2026.09.30

120

10

LLVM RISC-V参数配置教程
LLVM RISC-V参数配置教程

本专题介绍LLVM对RISC-V基础ISA和扩展的支持方式,涵盖RV32、RV64、标准扩展、实验性扩展、厂商扩展、-menable-experimental-extensions和版本差异。

2026.09.30

100

14

LLVM IR中间表示入门指南
LLVM IR中间表示入门指南

本专题整理LLVM IR的核心概念,包括中间表示作用、模块结构、函数、基本块、SSA形式、类型系统和常见语法,帮助新手理解LLVM编译流程中的关键层。

2026.09.30

80

12

PDF转图片方法
PDF转图片方法

需要把 PDF 页面用于上传、预览、分享或图片归档时,PDF 转图片方法专题整理 JPG/PNG 格式选择、逐页导出、清晰度设置、批量下载和结果检查等流程,帮助用户稳定完成 PDF 图片化处理。

2026.09.30

60

26

PixTV AI视频生成与无限画布创作
PixTV AI视频生成与无限画布创作

PixTV专题整理AI视频与视觉内容创作相关功能使用教程,涵盖AI生图、视频生成、无限画布、多模型创作、素材管理、声音音乐及视频剪辑等功能,帮助用户快速掌握PixTV从创意到成片的完整制作方法。

2026.09.29

80

15

Buffalo框架数据库开发全教程
Buffalo框架数据库开发全教程

本专题围绕Buffalo框架数据库开发,讲解database.yml多环境配置、soda与fizz迁移生成回滚、模型结构体标签、增删改查与条件查询、一对多与多对多关联、数据校验、回调钩子、事务处理及原生SQL执行能力。

2026.09.23

280

15

热门下载

更多
网站特效
/
网站源码
/
网站素材
/
前端模板

精品课程

更多
热门推荐
/
最新课程
phpStudy极速入门视频教程
phpStudy极速入门视频教程

共6课时 | 54.6万人学习

独孤九贱(4)_PHP视频教程
独孤九贱(4)_PHP视频教程

共89课时 | 133.4万人学习