扣子知识库精准召回需上传前做好三件事:检查文档真实结构并匹配分段逻辑、彻底清洗无关内容、统一字段对齐;再通过测试查询和分段管理验证效果。
☞☞☞AI 智能聊天, 问答助手, AI 智能搜索, 多模态理解力帮你轻松跨越从0到1的创作门槛☜☜☜

想让扣子知识库真正理解你的文档、精准召回关键信息,不是上传完就万事大吉——分段逻辑错、清洗规则松、字段没对齐,都会导致后续提问时答非所问、漏掉重点。
上传前必须做的三件事
打开你要上传的原始文档,用记事本或Word检查真实结构。如果全文是纯段落堆叠、无标题层级,就别选「按标题分段」;如果每段都带编号如「1.」「②」「(三)」,这些就是天然的分段标识符,必须在清洗页手动填入。
把文档中所有无关内容删干净:页眉页脚、重复水印、扫描件OCR残留乱码、编辑备注括号(如【待确认】)、作者署名行。这些字符会污染向量切片,让模型误判语义边界。
【清洗前务必另存为UTF-8编码的TXT文件】,尤其当原文来自微信公众号复制粘贴、Notion导出或PDF OCR时,隐藏的格式控制符(如零宽空格、软回车)会导致分段错位,且错误不可见。
分段设置实操指南
进入知识库创建流程 → 上传文件后点击「下一步」→ 在「数据清洗」页操作:
方法一:自动分段(适合结构清晰的长文)
直接启用「自动分段与清洗」,系统会按语义断句。但注意:若原文平均段落长度明显小于500字(比如全是30字以内的要点罗列),自动模式会把多个要点硬拼成一段,破坏信息粒度。
方法二:自定义分段(推荐用于笔记、SOP、FAQ类内容)
关闭自动模式 → 分段标识符填「。!?;」→ 分段最大长度设为300 → 勾选「去除空白行」→ 点击「预览分段效果」。这时你会看到每句话独立成块,检索时单句命中率远高于拼接段落。
方法三:强制按换行分段(仅限纯文本清单)
标识符填「\n」→ 最大长度留空 → 预处理规则中取消勾选「合并连续空白行」。这一步专治从Excel复制的条目列表,确保每行一个知识点,不被吞掉换行符。
字段对齐:让知识库记住“这是什么”
上传多份同类文档(如10篇产品说明书)时,必须统一字段结构。进入「添加文档」页面后,不要直接点「上传」,先点「添加字段」:
① 字段名填「适用机型」,类型选「单行文本」,值来源选「从文档中提取」→ 在弹窗里输入正则:适用机型[::]\s*(\S+) → 测试提取结果是否准确;
② 再加一个字段叫「故障代码」,类型选「多行文本」,值来源选「手动填写」→ 后续每上传一份说明书,都补上对应代码列表;
③ 最后加字段「更新日期」,类型选「日期」→ 手动填入文档实际发布日,不是你上传当天的日期。
字段一旦保存,后续所有上传文档都必须填写完整,否则该文档在知识库中将无法被按字段过滤或排序,等于半废状态。
验证召回效果的两个动作
知识库状态变成「已就绪」后,别急着接入Bot。先做两件事:
在知识库详情页点击「测试查询」→ 输入一个冷门但明确的术语(如文档里出现过一次的型号缩写),看返回片段是否包含上下文完整的句子,而不是孤立词;
打开「分段管理」页 → 随机点开3个分段 → 检查顶部显示的「来源文档名」和「位置」是否真实存在,若显示「unknown_001」或页码为0,说明原始文件编码或结构异常,需退回第一步重处理。











