ai生成摘要质量评估需四步:一、用rouge-1/2/l比对标准摘要,rouge-l f1>0.45为可用;二、三人双盲人工评分,五维均值<3.0即存缺陷;三、关键信息点覆盖率<70%需重生成;四、nli验证事实一致性,≥2个高风险偏差即不合格。
☞☞☞AI 智能聊天, 问答助手, AI 智能搜索, 多模态理解力帮你轻松跨越从0到1的创作门槛☜☜☜

如果您使用千问模型生成摘要,但难以判断其质量优劣,则可能是由于缺乏系统化的评估方法和可量化的质量指标。以下是衡量AI生成摘要质量的具体操作步骤:
一、使用ROUGE系列指标进行自动比对
ROUGE(Recall-Oriented Understudy for Gisting Evaluation)是一组基于n-gram重叠度的自动评估指标,适用于与参考摘要进行客观比对。它通过计算生成摘要与人工标注标准摘要之间的词序列匹配程度来量化质量。
1、准备至少一个由领域专家撰写的标准摘要(Reference Summary),长度与模型输出摘要相近。
2、将生成摘要与标准摘要分别分词,并统一转换为小写、去除标点及停用词。
3、调用ROUGE-1(unigram)、ROUGE-2(bigram)、ROUGE-L(最长公共子序列)三种指标分别计算召回率、精确率与F1值。
4、重点关注ROUGE-L F1值高于0.45的摘要,通常表明语义连贯性与关键信息覆盖度达到可用水平。
二、开展人工双盲评分
人工评估能弥补自动指标在语义合理性、逻辑连贯性和事实一致性方面的盲区。采用结构化评分表可提升判别信度。
1、邀请至少三位具备领域背景的评估者,彼此不交流评分结果。
2、每位评估者独立依据五维量表对摘要打分:完整性(是否涵盖原文核心事件/结论)、准确性(是否存在事实扭曲或捏造)、简洁性(有无冗余重复)、连贯性(句子间逻辑是否自然)、可读性(术语使用是否恰当)。
3、取三人评分均值作为最终得分,单项低于3.0分即判定为存在显著缺陷。
三、执行关键信息点覆盖率检测
该方法聚焦于摘要是否保留原文中不可省略的事实单元,尤其适用于技术文档、会议纪要等强信息密度文本。
1、从原文中人工提取10–15个不可替代的关键信息点(如“决策项:Q3上线新风控模型”“责任人:张伟”“截止时间:2026年8月15日”)。
2、逐条核查生成摘要中是否显式包含或可通过推理明确导出对应信息点。
3、统计覆盖数量占总信息点的比例,覆盖率低于70%的摘要应被退回重生成。
四、运行事实一致性验证脚本
利用轻量级NLI(Natural Language Inference)模型对摘要中的每个主张与原文片段进行蕴涵关系判定,识别潜在幻觉。
1、将摘要拆解为独立命题句(例如:“项目预算削减20%”“测试周期延长至六周”)。
2、对每个命题,检索原文中最相关段落,构造(前提,假设)对输入NLI分类器。
3、若某命题被判定为“矛盾”或“中立”,且置信度>0.85,则标记为高风险事实偏差。
4、整篇摘要中出现≥2个高风险偏差,即视为不合格输出。











