需用utf-8无bom编码、统一unix换行、剔除非正文内容、压缩冗余空格;按语义单元分块,设1200 token重叠区;首块注入结构化指令,每块独立执行并保存json输出。
☞☞☞AI 智能聊天, 问答助手, AI 智能搜索, 多模态理解力帮你轻松跨越从0到1的创作门槛☜☜☜

你需要分析一部长达87万字的网络小说,检查主角人设是否前后矛盾、关键伏笔是否回收、时间线有无错乱——传统分章喂入模型会导致上下文割裂,角色名缩写变化(如“林晚”→“晚晚”→“林工”)被误判为不同人物,伏笔回收间隔超30章时模型根本记不住前情。MiniMax M3支持1M tokens上下文,但直接丢进整本TXT会触发截断或OOM,必须做精准预处理。
确认原始文本编码与换行规范
用VS Code或Notepad++打开小说源文件,右下角查看编码格式,【必须是UTF-8无BOM】,若显示GBK/ANSI,立即转码,否则M3解析时会出现大量字符,导致后续所有分析失效。
按Ctrl+H调出替换框,搜索\r\n(Windows换行),全部替换成\n(Unix换行)。M3对\r\n兼容性差,混合换行会使段落间距崩坏,影响剧情节奏识别。
裁剪无效内容并压缩冗余空格
删除封面页、目录、作者后记、广告插页等非正文章节,只保留从“第一章”到“终章”之间的纯正文。
用正则表达式替换:搜索\s{3,},替换为空格。小说TXT常含大量制表符和连续空格,不清理会导致token数虚高——87万字原始文件可能膨胀到1.2M tokens,超出M3上限。
方法一:用Python脚本批量处理
读取文件→re.sub(r'\s+', ' ', text)→strip()→保存。这一步不能跳过,手动删空格极易漏掉隐藏的全角空格或零宽字符。
分块策略与重叠锚点设置
第一步:计算安全输入长度
M3标称1M tokens,实测稳定上限为92万tokens。预留8万容错空间,目标控制在920k内。
第二步:按语义单元切分而非固定字数
不按每5万字硬切,而是以“章节结尾+空行+下一章标题”为天然断点。重点保护三类锚点不被截断:【角色首次登场段落、伏笔句所在整段、跨章回忆闪回的起止位置】。
第三步:设置1200 token重叠区
每个分块末尾保留最近3个完整场景对话+1个环境描写段,避免“他推开木门”在块A结尾、“门后是血迹斑斑的祭坛”在块B开头——这种割裂会让M3误判为两个独立事件。
构造Prompt指令并注入结构化约束
在首块输入前插入系统指令段:
“你是一名资深文学编辑,正在逐帧分析长篇小说。严格遵循:①所有角色名以首次出现的全名为准(例:‘沈砚之’出现后,禁止简称为‘沈先生’);②时间线索用‘第X日’统一标注,禁止‘三天后’‘翌日’等模糊表述;③发现伏笔未回收,在对应段落末尾加【未闭环】标记。”
这一步必须手写,不能依赖模型自动归纳。M3若无强约束,会把“她摘下发簪”和“发簪刺入咽喉”当成两个无关动作,错过关键道具复用。
执行推理并提取结构化输出
将处理好的首块文本(含系统指令)粘贴至MiniMax控制台,temperature设为0.3,top_p设为0.85,关闭streaming。
等待响应完成,复制返回的JSON格式结果(含角色关系表、时间线轴、伏笔追踪矩阵),保存为analysis_part1.json。
将下一块文本(含1200 token重叠区)粘贴,重复执行,注意每次都要带相同的系统指令段——M3不会跨请求记忆指令,漏掉会导致后几块分析标准不一致。











