可借助python实现三种本地文档自动摘要方法:一、用textrank算法基于句子相似度提取关键句;二、调用minilm嵌入模型通过句向量聚类生成语义摘要;三、基于tf-idf关键词匹配实现规则驱动摘要。
☞☞☞AI 智能聊天, 问答助手, AI 智能搜索, 多模态理解力帮你轻松跨越从0到1的创作门槛☜☜☜

如果您希望快速提取本地文档的核心内容,但手动阅读和归纳耗时费力,则可以借助 Python 编写一个轻量级的自动摘要工具。以下是实现该功能的具体步骤:
一、使用 TextRank 算法提取关键句
TextRank 是一种无监督图模型算法,不依赖预训练语言模型,仅通过句子间相似度构建图结构并迭代计算重要性得分,适合离线运行且对中文支持良好。
1、安装所需库:pip install jieba numpy networkx
2、读取本地文档(支持 .txt 或 UTF-8 编码的 .md 文件),用 jieba 对全文分词并按句切分。
3、构建句子相似度矩阵:对每对句子计算基于词重叠的余弦相似度,仅保留非零上三角部分。
4、将句子作为节点、相似度作为边权重,输入 NetworkX 构建无向加权图。
5、调用 nx.pagerank() 计算各句子得分,选取得分最高的前 3 句作为摘要输出。
二、调用本地部署的 MiniLM 嵌入模型生成语义摘要
MiniLM 是轻量级 Transformer 模型,可在 CPU 环境下运行,通过句向量聚类与中心句选取,提升摘要的语义连贯性。
1、安装依赖:pip install sentence-transformers
2、加载 all-MiniLM-L6-v2 模型(约 80MB,支持中英文)。
3、将文档按标点切分为句子列表,过滤掉长度小于 10 字符的碎片句。
4、批量编码所有句子,获取 384 维嵌入向量。
5、对向量集执行 KMeans 聚类(K=3),取每类中距离簇心最近的句子组成摘要。
三、基于规则的关键词驱动摘要生成
该方法完全规避模型依赖,利用 TF-IDF 提取文档高频实词,再反向匹配包含最多关键词的句子,确保摘要紧扣原文主题。
1、读取文档后去除停用词(使用 cn_stopwords.txt 列表)。
2、统计词频并结合逆文档频率(以当前文档为唯一语料,IDF 设为 log(1+1/词频))计算 TF-IDF 值。
3、选取 TF-IDF 得分 top-5 的名词或动词作为关键词集合。
4、遍历所有句子,统计每句中关键词出现次数,选取累计次数最高的前 3 句。
5、按原始文档顺序重排选中句子,避免逻辑断裂。
Python免费学习笔记(深入):立即使用
在学习笔记中,你将探索 Python 的核心概念和高级技巧!











