longcat ai不支持知识库整理,需改用国产大模型清洗数据、chromadb+langchain建本地知识库、notion/obsidian做ai校准,并注意文件命名、原子化标签和限定查询范围。
☞☞☞AI 智能聊天, 问答助手, AI 智能搜索, 多模态理解力帮你轻松跨越从0到1的创作门槛☜☜☜

一、用 GPT 或国产大模型做“数据清洗+问答对生成”
知识库不准,90%源于原始资料太杂:PDF 扫描乱码、网页广告混入、语音转文字错漏、微信长文无段落。AI 整理前必须先“洗数据”。
- 把原始文件(TXT/PDF/MD)统一转成纯文本,删掉页眉页脚、广告链接、重复标题
- 用 ChatGLM4、Qwen3 或 DeepSeek-V3(本地部署或 API)执行两步 Prompt:
- 第一步:“请通读以下内容,识别并列出 5–8 个最值得长期复用的核心问题(要求覆盖定义、原理、误区、案例、操作步骤)”
- 第二步:“根据上述问题,严格按 JSON 格式生成问答对,每个 item 包含 'question' 和 'answer' 字段,answer 必须直接来自原文,不增不减,不解释”
二、用 ChromaDB + LangChain 搭轻量本地知识库
不用买服务器,笔记本就能跑。重点不是“存得多”,而是“搜得准”。
- 安装:
pip install chromadb langchain sentence-transformers - 切片时设 chunk_size=256(中文短句更敏感),禁用重叠(
chunk_overlap=0)避免语义污染 - 嵌入模型选 bge-m3(2025年新出,中英混合检索强,支持关键词+语义双路召回)
- 查询时不写“总结一下”,而写“请从知识库中找出‘OKR复盘失败的三个典型归因’,只返回原文原句,标注出处文件名”
三、在 Notion 或 Obsidian 中激活“AI 校准层”
让 AI 不只是摘要,而是持续校验你的知识体系是否自洽。
- 在 Notion 数据库里建字段:来源可信度(1–5星)、最后校准日期、是否与#产品规范冲突
- 每周运行一次指令:“比对【知识库参考资料】中所有带#产品规范标签的笔记,检查当前页面中关于‘灰度发布流程’的描述是否与其第4.1条一致;若不一致,请标红并写出差异点”
- Obsidian 用户可配合 Codex 插件,把个人写作习惯、常用术语表、项目阶段目标写成 .md 文件放入 vault,AI 回答时自动加载为 context
四、关键避坑提醒
很多人卡在“整理完还是找不到”,问题常出在三个隐形环节:
- 文件名即元数据:不要叫“资料1.pdf”,改用“20250312_客户投诉SOP_v2.1.pdf”,AI 切片时会自动提取时间、主题、版本
- 标签必须原子化:用 #OKR 而非 #绩效管理OKR,避免语义模糊导致向量漂移
- 拒绝全库扫描:每次提问前加限定,例如“仅基于【2025技术复盘】笔记本中的内容回答”,否则 AI 会从噪音里强行编造









