longcat ai 不支持全自动无监督分类,但可通过 ragflow + longcat 模型组合实现语义驱动、规则辅助的智能分类;需明确定义5–12个互斥类别及人工撰写的定义描述,配合少量标注样本与定制化系统提示词,调用 longcat-flash-chat 进行精准打标,并通过抽样复核与迭代优化提升效果。
☞☞☞AI 智能聊天, 问答助手, AI 智能搜索, 多模态理解力帮你轻松跨越从0到1的创作门槛☜☜☜

LongCat AI 本身不直接提供“全自动无监督分类”功能,但可以通过 RAGFlow + LongCat 模型组合,实现知识库文档的语义驱动、规则辅助的智能分类。关键不是让模型凭空打标签,而是构建一个可配置、可验证、可迭代的分类流水线。
明确分类目标与标签体系
自动分类的前提是定义清晰、互斥、可覆盖的类别集合。比如你的知识库是技术文档,类别可以是:安装指南|API说明|故障排查|最佳实践|版本更新。不要用模糊词(如“其他”“通用”),避免模型混淆。标签数量建议控制在5–12个以内,太多会显著降低准确率。
- 每个类别需配1–3句人工撰写的“定义描述”,例如:“故障排查:包含错误码、报错现象、原因分析和具体解决步骤的文档”
- 可额外准备少量已标注样本(每类3–5篇),用于后续效果校验或微调提示词
在 RAGFlow 中配置语义分类工作流
RAGFlow v0.20.5 支持通过“知识库配置 → 高级设置 → 分类器”启用基于 embedding 的相似度聚类,但更稳定的做法是用 LongCat-Flash-Chat 做主动判别:
- 上传文档后,在“知识库 → 解析”完成前,勾选启用元数据提取,并开启“使用大模型生成元数据”选项
- 进入“模型配置”,确保已正确接入 LongCat 的 chat 模型(Meituan 提供)和硅基 embedding 模型(用于向量检索基础)
- 在“系统提示词(System Prompt)”中写入分类指令,例如:
“你是一个技术文档分类助手。请严格从以下类别中选择唯一最匹配的一项:[安装指南, API说明, 故障排查, 最佳实践, 版本更新]。只输出类别名称,不要解释,不要加标点。”
利用 LongCat 的强推理能力做精准打标
LongCat-Flash-Chat 在短文本分类任务上表现突出,尤其擅长理解技术语境和指令约束。实际操作中:
- 对每篇新解析完成的文档块(chunk),RAGFlow 可调用 LongCat 接口,将文档标题+首段正文+分类指令一起发送
- 模型返回纯文本类别名后,RAGFlow 自动写入该 chunk 的元数据字段
category - 支持批量异步处理,100 篇文档通常在 2–3 分钟内完成分类(依赖 API 响应速度)
- 分类结果可在“知识库 → 文档列表”中按
category字段筛选,也可导出 CSV 进行人工复核
持续优化分类效果
首次运行后,建议抽样检查 20–30 篇文档的分类结果。常见问题及应对方式:
- 多类别混淆(如把“API说明”误标为“最佳实践”)→ 在系统提示词中补充区分定义,例如:“API说明必须包含请求URL、参数列表、响应示例;最佳实践侧重场景化配置建议和避坑提醒”
- 长文档分块导致标签不一致→ 在“切片方法”中选择 Markdown Heading 或 Paragraph,避免跨主题切分
- 冷启动偏差→ 先用 50 篇人工标注文档训练一个轻量级分类器(如 scikit-learn 的 LogisticRegression),作为 LongCat 分类前的初筛层










