基于glm-5可实现pdf文档自动构建高质量qa数据集,含五种方法:一、glm-5+glm-ocr联合解析结构;二、分块语义引导批量生成;三、异步agent rl迭代校验;四、rag闭环优化;五、长上下文跨章节关联问答生成。
☞☞☞AI 智能聊天, 问答助手, AI 智能搜索, 多模态理解力帮你轻松跨越从0到1的创作门槛☜☜☜

如果您拥有企业规章制度、技术手册或产品文档等PDF文件,但缺乏结构化问答数据用于训练或测试大模型,则可能是由于文档格式非结构化、语义关系隐含、人工标注成本高等原因导致QA对生成困难。以下是基于GLM-5实现文档自动构建高质量QA数据集的多种方法:
一、使用GLM-5+GLM-OCR联合解析文档结构
该方法利用GLM-OCR对扫描件或复杂排版PDF进行高精度版面分析与文字识别,再由GLM-5理解段落层级、标题-正文映射关系,从而精准定位潜在问题源(如条款标题、加粗定义)与对应答案范围(如下文解释、细则、例外情形)。此路径适用于含图表、多栏、页眉页脚的制度类PDF。
1、下载并部署GLM-OCR项目,执行./start_vllm.sh启动服务,确保Gradio Web界面在7860端口可用。
2、将待处理PDF上传至GLM-OCR Web界面,选择“结构化输出”模式,导出JSON格式结果,其中包含type(如title、paragraph、list-item)、content及parent_id字段。
3、将JSON中所有type=="title"的节点内容作为候选问题种子,将其直接下挂的paragraph节点内容拼接为初始答案,去除冗余换行与编号前缀。
4、将每组“标题+正文”输入GLM-5模型,调用时在extra_body中设置{"enable_thinking": true},提示词为:“你是一名QA生成专家。请基于以下制度条款,生成3个不同角度的自然语言问题,并确保每个问题的答案严格来自所给文本,不添加任何外部信息。输出格式为:Q1:…\nA1:…\nQ2:…\nA2:…”
二、基于分块语义引导的GLM-5批量生成
该方法先对纯文本文档进行语义分块,再为每块注入关键词标签,驱动GLM-5聚焦生成覆盖事实、条件、例外、操作步骤等维度的问题,避免泛化或遗漏关键约束。适用于已转为UTF-8文本的长文档,如技术白皮书或API文档。
1、对文档执行文本清洗:统一编码为UTF-8,移除页眉页脚、乱码字符及重复空行。
2、按语义边界切分文本块:使用nltk按句分割后,合并相邻句子直至达到500–1500字长度,且保证逻辑完整(如不切断“如果…则…”条件句)。
3、对每个语义块运行jieba+TextRank提取3–5个核心关键词,例如某块含“SSH密钥登录”“公钥格式”“authorized_keys文件”,则标注为[SSH, 密钥, authorized_keys]。
4、构造Prompt发送至GLM-5 API:以“角色:QA生成专家;任务:基于以下带标签的语义块,生成5个问题,每个问题必须显式包含至少1个标注关键词;答案必须逐字出自块内原文”为指令,附上语义块文本与关键词列表。
三、采用异步Agent RL增强的迭代式QA校验生成
该方法引入GLM-5内置的异步智能体强化学习机制,让模型在生成QA对后自动执行自我验证:检索原始文档片段、比对答案完整性、检测问题歧义性,并根据反馈重写低质量条目。适用于对准确率要求严苛的法务、合规类知识库构建。
1、准备原始PDF与对应OCR纯文本,建立双向锚点映射表(如“第3章第2条→text_offset: 1240–1890”)。
2、调用GLM-5生成首轮QA对,启用enable_thinking参数,强制模型在输出前生成推理链,记录其引用原文的偏移位置。
3、启动校验Agent:将每个答案文本送入文档全文检索模块,验证是否能在指定偏移范围内精确匹配;若匹配失败或匹配长度<答案长度的90%,标记该QA对为“待重写”。
4、将“待重写”样本连同校验失败日志(如“答案‘需提前5个工作日’未在offset 1240–1890中出现”)重新输入GLM-5,提示其“修正问题指向性,严格限定答案来源范围”。
四、通过RAG系统闭环优化QA质量
该方法将GLM-5嵌入RAG流程,使其在生成问题时实时检索相似历史QA对与用户真实提问日志,动态调整问题表述风格与粒度,确保生成内容贴近实际使用场景。适用于已有线上问答系统需持续扩充测试集或冷启动知识库的场景。
1、搭建RAG服务:以历史QA对、客服工单、员工搜索日志为向量库,使用GLM-5的embedding能力生成稠密向量并存入ChromaDB。
2、对新文档语义块生成初始QA后,将每个问题嵌入向量空间,检索Top-3相似历史问题及对应答案。
3、将检索结果拼接进Prompt:“参考以下3个相似问题及其答案风格,请重写当前问题,使其更符合一线员工口语习惯(例如将‘依据第X条规定’改为‘我请假要怎么操作?’),答案保持原文不变。”
4、调用GLM-5执行重写,输出结果直接入库,同时将新QA对反哺至向量库,完成闭环更新。
五、利用GLM-5长上下文能力进行跨章节关联问答生成
该方法突破单页/单段限制,激活GLM-5的200k上下文窗口,使其能同时感知制度总则、分则、附则中的条款冲突、引用关系与例外说明,从而生成需跨章节推理的高阶QA对。适用于《员工手册》《数据安全管理办法》等强逻辑依赖型文档。
1、将整份PDF解析为连续纯文本,保留章节标题与编号(如“第四章 第二十二条”),总长度控制在180k token以内。
2、识别文档中所有显式交叉引用,例如“详见第二章第八条”“参照附件三”,构建引用关系图谱。
3、向GLM-5提交完整文本及图谱摘要,提示词强调:“请生成至少2个需整合≥2个章节信息才能回答的问题,例如‘第三章规定的审批权限与第五章例外情形叠加时,最终由谁批准?’,答案必须列出所依据的具体条款编号及原文。”
4、启用streaming输出并捕获reasoning_content字段,验证模型是否真实调用图谱进行多跳推理,而非仅靠表面关键词匹配。











