需清洗文本、按语义分块(180~350字/块)、保留编号,用bge-zh-v1.5嵌入模型配置向量检索,绑定bot并设置严格提示词以确保精准问答。
☞☞☞AI 智能聊天, 问答助手, AI 智能搜索, 多模态理解力帮你轻松跨越从0到1的创作门槛☜☜☜

你需要用扣子(Coze)搭建一个能精准回答百万字级长文档内容的问答库,不是简单上传PDF就完事——原始文本必须分块、向量化、建立语义索引,否则模型根本找不到关键段落。
准备原始长文本并清洗结构
把分散的Word、TXT、Markdown等格式文档统一转为纯文本,删除页眉页脚、页码、无关图表说明、重复标题行;保留章节编号和换行逻辑,因为后续分块依赖自然段落边界。
用Notepad++或VS Code打开文件,执行正则替换:查找\r\n\s*\r\n→替换为空行,确保段落之间只有单个空行;再删掉所有以“图”“表”开头的整行,这类描述对问答无意义。
这一步不做干净,后面切块会把图注和正文混在一起,导致检索时返回乱码答案。
按语义粒度切分文本块
方法一:用Python脚本自动分块
安装langchain后运行以下代码:读取清洗后的txt→按中文标点(。!?;)切句子→合并连续短句(每块控制在180~350字)→丢弃纯数字行或少于10字的碎片。
方法二:人工校准关键段落
对政策条文、技术参数、合同条款等高价值内容,手动以“条”“款”“项”为单位拆分,每块开头保留原文编号如“第三章 第十二条”,【编号必须保留在块首行,否则扣子无法关联上下文】。
在扣子中创建知识库并上传分块文件
登录Coze后台→点击左侧「知识库」→「新建知识库」→填写名称(例如“XX产品技术白皮书V3.2”)→选择「文档型」→点击「上传文件」。
上传前确认:文件编码是UTF-8,扩展名是.txt,单文件不超过20MB;不要传压缩包,扣子不支持解压解析。
扣子 (Windows) 是字节跳动推出的一站式 AI Agent 平台客户端,支持多 Agent 协作、可视化工作流和知识库管理。最新版本新增 Claude Code 与 Codex CLI 接入、多端同步和项目级管理功能,同时优化了插件生态和 AI 响应速度,让用户在 Windows 上即可高效创建、运行和协作智能体,满足个人、团队及企业场景需求。
上传后等待状态变为「已处理完成」,此时右侧会显示「共提取X个文本块」,若数字明显少于你预估的分块数,说明清洗或切块出错,需回溯前两步。
配置嵌入模型与检索策略
第一步:点击知识库右上角「设置」→「嵌入模型」选「bge-zh-v1.5」(中文场景精度最高)→保存。
第二步:在「检索设置」中关闭「关键词匹配」,只保留「向量检索」→将「返回结果数」设为5→开启「启用上下文重排序」。
第三步:测试检索效果——在「调试」页输入“如何申请售后延保”,观察返回的5个文本块是否都来自“售后服务”章节;如果出现“包装规范”“物流时效”等无关块,说明分块时未隔离业务域,要回到第二步重新切分。
这一步不能跳过,默认模型对中文长文本召回率不足40%,必须手动指定bge-zh-v1.5才能稳定达到85%+相关性。
绑定Bot并设置提示词强化指令遵循
新建Bot→在「知识库」模块勾选刚建好的库→进入「对话流」→点击「系统提示词」编辑框。
粘贴以下内容(不可删减):
你是一个专业文档问答助手。仅依据已加载的知识库内容回答,禁止编造、推测、引用外部信息。当问题涉及多个条款时,按原文顺序逐条引用编号(如“第四章第三条”),不合并解释。若知识库无对应内容,回答“未在文档中找到相关信息”。
发布Bot,用真实业务问题测试:输入“第2.3.1条规定的响应时限是多少”,检查回复是否精确到“2小时”,且带原文编号。










