longcat ai 不直接提供文档自动分块切片功能,而是作为轻量智能体运行时调度外部封装的切片工具;它通过意图解析、工具选择与协调执行,支持自然语言指令触发语义感知的文档分块处理。
☞☞☞AI 智能聊天, 问答助手, AI 智能搜索, 多模态理解力帮你轻松跨越从0到1的创作门槛☜☜☜

LongCat AI 本身不直接提供“文档自动分块切片”功能,它不是 RAG 框架中的 chunking 工具(如 LangChain 的 TextSplitter),而是面向任务执行的轻量智能体运行时。但你可以用 LongCat-2.0 + kimi-k2.7-code 的组合,**调用外部切片逻辑或封装自定义工具**,实现文档内容的自动化、上下文感知的分块处理。
明确角色分工:LongCat 不切片,但能调度切片
LongCat-2.0 的核心是“意图解析 → 工具选择 → 协调执行 → 结果组装”。它不内置文本分块算法,但支持你把切片逻辑封装为标准 Tool(例如 Python 函数),再通过自然语言指令触发调用。比如输入:
“把 ./manual.pdf 按语义段落切分成 512 字符以内、重叠 64 字的块,保存为 chunks.json,并统计每块关键词”
LongCat 会识别出需调用 PDF 解析、语义分块、关键词提取三个工具,并按依赖顺序串行执行——前提是这些工具已注册进它的 ToolCall 协议体系。
三步完成可落地的切片配置
-
第一步:准备切片工具函数
写一个符合 ToolCall 规范的 Python 函数,支持多种策略(如递归分块、标题感知切分、代码块保留等)。示例关键逻辑:
– 用 PyMuPDF 或 pdfplumber 提取文本+结构信息
– 利用 sentence-transformers 或 spaCy 做语义边界检测
– 输出为 List[{"id": "chunk_001", "text": "...", "metadata": {...}}] -
第二步:注册为 LongCat 可调用工具
在 LongCat-2.0 的 tools/ 目录下新增文件(如 chunker.py),按约定格式导出 tool_spec 和 execute 方法;启动时自动加载,无需重启服务。 -
第三步:用自然语言触发,带参数控制
支持在指令中指定策略和参数,例如:
“用语义切分法处理 README.md,块大小 384,重叠 32,跳过注释行”
LongCat 会提取参数并传入工具,避免硬编码或改代码。
为什么推荐这种“外挂式”切片而非内置?
因为真实业务中文档类型差异极大:PDF 手册需保留章节标题,Markdown 文档要识别 # 二级标题,代码文件得按函数/类边界切,日志则适合固定长度+滑动窗口。LongCat 的设计哲学是“不预设结构,只调度能力”,让你自由组合切分器、清洗器、向量化器,形成适配具体知识库的 pipeline,而不是套用一刀切的默认策略。
进阶提示:结合 RAG 流程闭环验证
切片完成后,可继续让 LongCat 调用 Chroma 或 Qdrant 客户端执行向量化入库,再用模拟 query 测试检索召回率。整个流程(PDF → 切片 → embed → store → retrieve)都能用一句指令驱动,无需切换多个平台或手写胶水代码。











