扣子知识库需通过robots.txt校验、url清洗、自动提取正文及定时/webhook同步实现增量更新。启用智能去重并校验更新时间,确保只同步新增或修改的html正文,避免重复抓取。
☞☞☞AI 智能聊天, 问答助手, AI 智能搜索, 多模态理解力帮你轻松跨越从0到1的创作门槛☜☜☜

你需要让扣子知识库自动获取指定网页内容,并在后续保持更新,避免重复抓取旧数据、跳过已收录页面、只同步新增或修改过的HTML正文——这不是手动复制粘贴能解决的问题。
确认目标网页是否允许被爬取
打开目标网页,在浏览器地址栏输入网址后按回车,等待页面完全加载,右键→查看网页源代码→搜索robots.txt,或直接在网址末尾加上/robots.txt(如https://example.com/robots.txt)并访问。
如果返回404,说明网站未设置爬虫限制;若返回文本内容,检查其中是否有Disallow: /或针对coze-bot、user-agent: *的禁止规则。
若存在Disallow: /且无例外声明,【强行抓取将违反网站服务条款,扣子知识库可能被封禁IP或触发反爬机制】。
在扣子后台添加网页知识库条目
进入扣子 Bot 编辑页→点击左侧「知识库」→点击「+ 新建知识库」→选择「网页」类型。
在「网页 URL」输入框中粘贴单个目标链接,例如https://help.coze.com/zh-CN/guides/knowledge-base-overview;支持一次提交最多50个URL,用换行分隔。
勾选「自动提取正文」,系统会跳过导航栏、广告位、页脚等干扰区块,只保留主文章区域文本;不勾选则会抓取整页HTML源码,后续检索易受噪音干扰。
设置定期同步频率与触发方式
方法一:使用扣子内置定时同步
在知识库详情页→点击右上角「…」→选择「编辑」→下滑至「同步设置」→开启「自动同步」开关→从下拉菜单中选择周期:1小时 / 6小时 / 24小时 / 7天。
方法二:通过 Webhook + 第三方调度器实现精确控制
在知识库详情页→点击「API 同步」→复制「同步触发 URL」;该地址含一次性 token,泄露即失效。
用 cron 表达式在服务器或云函数中定时发起 POST 请求,例如:curl -X POST "https://api.coze.com/v1/kb/sync?token=xxx"。
注意:Webhook 方式不会在扣子后台显示同步记录,需自行记录日志验证是否成功。
启用增量更新与去重逻辑
第一步:确保每个网页有稳定且唯一的 URL
动态参数如?utm_source=xxx、&v=2.1.0会导致同一页面被识别为多个新条目,必须在添加前统一清洗——删除所有?及之后的查询字符串,仅保留基础路径。
第二步:开启「智能去重」开关
该功能基于语义指纹识别重复内容,可有效防止因URL微调、页面模板更新导致的冗余分片入库。
第三步:校验同步结果是否生效
同步完成后,进入知识库分段预览区,观察最新分片的「更新时间」字段是否刷新为本次同步时刻;若仍显示旧时间,说明未触发实际更新,需检查URL清洗是否彻底或robots.txt是否新增了限制。











