文本超2800字须按语义段落智能拆分:用正则匹配空行或标题层级切分,再通过loop节点逐段处理,最后双换行拼接,避免逻辑断裂与静默截断。
☞☞☞AI 智能聊天, 问答助手, AI 智能搜索, 多模态理解力帮你轻松跨越从0到1的创作门槛☜☜☜

处理超过3000字的合同、报告或技术文档时,直接喂给大模型常出现关键条款遗漏、逻辑链断裂、重点被稀释的问题。这是因为扣子平台调用的主流大模型存在上下文窗口硬限制,超出部分会被自动截断或降权处理。
判断文本是否需要拆分
打开待处理文本,在扣子工作流中新建一个Code节点,粘贴以下Python代码:
```python
len(user_input.replace(' ', '').replace('\n', ''))
```
运行后若返回值【大于2800】,必须拆分——留200字余量是为系统提示词和输出格式预留空间,硬超会触发静默截断,且不报错。
小于2800字的文本,直接进LLM节点处理即可,强行拆分反而增加冗余计算和拼接风险。
按语义段落智能切分
不要用固定字数切分。固定切法会把一段完整论证(如“原因→证据→结论”)硬生生劈成两半,导致后续润色失真。
方法一:用正则匹配自然段落边界
在Code节点中执行:
```python
import re
segments = re.split(r'\n\s*\n', user_input.strip())
segments = [s.strip() for s in segments if s.strip()]
```
该方法保留原文空行分隔逻辑,适合会议纪要、政策文件等结构清晰文本。
扣子 (Windows) 是字节跳动推出的一站式 AI Agent 平台客户端,支持多 Agent 协作、可视化工作流和知识库管理。最新版本新增 Claude Code 与 Codex CLI 接入、多端同步和项目级管理功能,同时优化了插件生态和 AI 响应速度,让用户在 Windows 上即可高效创建、运行和协作智能体,满足个人、团队及企业场景需求。
方法二:用标题层级切分(推荐用于技术文档/论文)
在Code节点中执行:
```python
import re
# 匹配一级到三级标题,如“1.” “1.1” “第一章” “### 小节”
title_pattern = r'^\s*(?:\d+\.\d+\.\d+|\d+\.\d+|\d+|[IVXLCDM]+\.\s+|第[一二三四五六七八九十]+[章节]\s*|#{1,3}\s+.+)$'
lines = user_input.split('\n')
segments = []
current = []
for line in lines:
if re.match(title_pattern, line.strip()):
if current:
segments.append('\n'.join(current))
current = [line]
else:
current = [line]
else:
current.append(line)
if current:
segments.append('\n'.join(current))
```
这段代码能识别中英文混合标题体系,避免把“1.2.3 优化方案”误判为普通编号列表。
设置分段处理工作流
第一步:拖入Loop节点,类型选“数组循环”,输入变量设为上一步生成的segments列表。
第二步:Loop内部放LLM节点,系统提示词必须包含明确指令:
“你正在处理整篇文档的第{index}个语义段落。请严格基于本段内容进行润色,不得引入其他段落信息,不得自行补充背景或结论。保持原意不变,仅提升表达准确性与专业性。”
第三步:在Loop节点后接一个Code节点,将所有润色后的段落用两个换行符拼接:
```python
output = '\n\n'.join(loop_result)
```
【注意:此处不能用单换行拼接】——单换行会导致段落间黏连,大模型在后续整体校验时无法识别段落边界,可能错误合并逻辑。










