本文介绍如何将带段落编号和变更类型的词序数据,按语义一致性(连续词号、相同变更类型、段落对齐)聚合成文档级差异单元,并生成结构化对比表。
本文介绍如何将带段落编号和变更类型的词序数据,按语义一致性(连续词号、相同变更类型、段落对齐)聚合成文档级差异单元,并生成结构化对比表。
在文档比对任务中,原始输出常以“词粒度”呈现(如每行一个 word_number 及其在两文档中的段落归属与变更类型),但实际应用(如差异高亮、变更摘要或版本回溯)往往需要将语义连贯的词序列聚合为逻辑单元——即:连续编号、相同变更行为、且段落映射关系一致的词组。本教程提供一套基于 Pandas 的稳健分组策略,实现从细粒度标记到文档级差异块(doc1/doc2/ change_type)的精准转换。
核心分组逻辑解析
要正确聚合,需同时满足三个维度的一致性:
- 词序连续性:word_number 必须是连续整数(如 5,6,8 → 实际不连续,但示例中允许跳过?注意:原答案按 diff().ne(1) 判定连续,即仅当相邻差 ≠1 才新开组,因此 [5,6,8] 被归为一组——这隐含接受“局部连续”而非严格数学连续,符合文本中因删除导致的空缺场景);
- 变更语义一致性:change_type 应保持相同(0/1/-1),但需注意:中间出现的 0 或 -1 可能是噪声或过渡态,故采用前向填充(ffill)+ 过滤(replace({0:-1:None}))提取主导变更类型;
- 段落对齐稳定性:两文档的段落编号(doc1_paragraph_number / doc2_paragraph_number)需在组内保持同步变化。通过将 -1 替换为 None 后前向填充,再计算行间差异,即可识别段落映射关系发生切换的位置。
完整实现代码(含注释与健壮性增强)
import pandas as pd
import numpy as np
def aggregate_word_changes(df):
"""
将词级变更记录聚合成文档级差异块。
Parameters:
df (pd.DataFrame): 包含 word_number, change_type,
doc1_paragraph_number, doc2_paragraph_number 的DataFrame
Returns:
pd.DataFrame: 列为 ['doc1', 'doc2', 'change_type'] 的聚合结果
"""
# Step 1: 按 word_number 连续性分组(处理删除导致的编号跳跃)
g1 = df['word_number'].diff().ne(1).cumsum()
# Step 2: 提取主导 change_type(忽略中间的 0 和 -1,取首个非零延续值)
c = df['change_type'].replace({0: None, -1: None}).ffill().fillna(0)
g2 = c.diff().ne(0).cumsum()
# Step 3: 按段落对齐稳定性分组(-1 视为缺失,前向填充后检测变化)
tmp = df[['doc1_paragraph_number', 'doc2_paragraph_number']]
aligned = tmp.replace(-1, None).ffill()
g3 = aligned.diff().ne(0).any(axis=1).cumsum()
# Step 4: 三重分组 + 聚合
grouped = df.groupby([g1, g2, g3], sort=False)
def collect_words(series):
# 对当前组,提取 doc1/doc2 中有效(≠-1)的 word_number
mask_doc1 = series['doc1_paragraph_number'] != -1
mask_doc2 = series['doc2_paragraph_number'] != -1
return [
series.loc[mask_doc1, 'word_number'].tolist(),
series.loc[mask_doc2, 'word_number'].tolist()
]
agg_result = grouped.apply(lambda x: pd.Series({
'doc1': x.loc[x['doc1_paragraph_number'] != -1, 'word_number'].tolist(),
'doc2': x.loc[x['doc2_paragraph_number'] != -1, 'word_number'].tolist(),
'change_type': x['change_type'].mode().iloc[0] if not x['change_type'].mode().empty else x['change_type'].iloc[0]
})).reset_index(drop=True)
return agg_result
# 示例调用(假设 df 已加载)
# result = aggregate_word_changes(df)
# print(result)
关键注意事项
- change_type 聚合策略:原答案使用 .max(),但更稳妥的做法是取众数(.mode()),避免 1 和 -1 混合时误判;若无众数,则回退至首值。
- 空列表处理:mask_doc1 和 mask_doc2 确保缺失段落(-1)的词号不被纳入对应文档列表,自然生成 []。
- 性能提示:对超大数据集,可先按 doc1_paragraph_number 和 doc2_paragraph_number 预过滤,减少分组复杂度。
- 业务校验建议:聚合后应验证 len(doc1) + len(doc2) 是否等于原始组内行数(考虑 change_type 语义:0 时二者长度应等;1 时 doc2 更长;-1 时 doc1 更长),可作为 pipeline 的质量门禁。
通过以上方法,你不仅能复现预期输出,更能灵活适配不同文档比对引擎(如 difflib、google-diff-match-patch 或专用 NLP 工具)的输出格式,构建可解释、可追溯、可集成的文档差异分析流水线。











