需将utf-8编码的txt文件经清洗、重命名后上传至阶跃ai平台,配置markdown或json转换规则(含标题识别、字段映射等),执行转换并校验下载结果。
☞☞☞AI 智能聊天, 问答助手, AI 智能搜索, 多模态理解力帮你轻松跨越从0到1的创作门槛☜☜☜

你需要把一堆杂乱的TXT文档快速转成结构清晰、能直接用于知识库或AI训练的Markdown或JSON格式,避免手动逐行调整标题层级、列表缩进和字段命名。
准备原始TXT文件
确保TXT文件是UTF-8编码,用记事本另存为时勾选“UTF-8”;若含中文但打开乱码,说明当前是GBK编码,必须先转码,否则后续解析会丢字或报错。
删除TXT里所有页眉页脚、空行堆叠(连续3行以上空白)、扫描件OCR残留乱码段落(如“口口口口”“■■■■”)——阶跃AI不自动清洗脏数据,这些内容会原样进入输出字段,污染结构。
将TXT文件重命名为英文名,不含空格和特殊符号,例如report_v1.txt。中文文件名在部分API调用中可能触发400错误。
登录并上传TXT到阶跃AI文档处理平台
访问 https://docs.jieyue.ai → 点击右上角【登录】→ 使用微信扫码或邮箱密码登录。
登录后点击【新建任务】→ 选择【文档格式转换】→ 点击【上传文件】按钮,拖入已准备好的TXT文件(单次最多5个,总大小不超过20MB)。
上传完成后,系统自动检测文本语言和基础结构;若左下角显示“未识别到章节标题”,说明TXT内无明确分级标识(如“一、”“1.”“##”等),此时需手动启用【智能分段】开关。
配置转换规则
方法一:转标准Markdown
通过 jina.ai 将网页抓取为精简的 markdown,用于在需要获取 URL 并获取压缩的 markdown 内容以节省 token。触发词 l...
在“输出格式”下拉菜单中选择【Markdown】→ 开启【自动识别标题层级】→ 设置【一级标题关键词】为“第.*章|一、|第一章”(正则表达式,匹配常见中文章节目录)→ 关闭【保留原文空行】(否则生成的MD会有多余换行破坏渲染)。
方法二:转结构化JSON
选择【JSON】格式 → 指定根字段名为"document" → 在【字段映射】区域点击【+新增字段】→ 输入字段名"content",类型选"text",来源选"全文主体";再点【+新增字段】→ 字段名设为"sections",类型选"array of object",来源选"按标题拆分" → 【必须勾选“启用标题锚点提取”】,否则sections数组为空。
方法三:混合输出(Markdown+JSON双份)
勾选【同时生成两种格式】→ 系统会在任务完成页提供两个下载按钮:一个md文件,一个json文件 → 注意:JSON文件中的字符串值默认带转义符(如换行符为\n),如需人工可读,请额外开启【JSON美化输出】开关。
执行转换并下载结果
第一步:点击页面底部【开始转换】按钮 → 等待状态栏从“排队中”变为“处理中”再变为“已完成”。
第二步:检查预览区左侧原始TXT与右侧生成结果是否对齐——特别核对标题层级是否降级(如原文“1.1.1”在MD中是否正确渲染为###),若发现三级标题被误判为段落,立即点击【重新配置】返回上一步,收紧标题正则表达式(例如改为“1\.1\.1|一\.一\.一”)。
第三步:确认无误后,点击【下载全部】→ 浏览器自动下载压缩包,解压后得到markdown.md和output.json两个文件。









