讯飞听见不直接生成结构化纪要,但通过准确转写、区分发言人、清洗文本及标准提示词,可支撑高质量结构化输出。需在录音阶段开启发言人区分、选用会议模型;导出前删除时间戳、合并断句、统一格式;用四段式提示词触发大模型输出;最后人工核验责任人、日期与结论的原始依据。
☞☞☞AI 智能聊天, 问答助手, AI 智能搜索, 多模态理解力帮你轻松跨越从0到1的创作门槛☜☜☜

讯飞听见本身不直接生成结构化纪要,但它能为结构化输出打下坚实基础——关键在于“转写准确”+“导出干净”+“后续提炼有依据”。真正实现结构化,需要它完成三件事:把声音变成可读文本、把文本分清谁说了什么、把文本导出来方便下一步处理。
一、录音阶段就埋好结构化伏笔
结构化不是后期硬凑出来的,而是从录音那一刻就开始设计的。重点做三件事:
- 开启“区分发言人”,哪怕只有两人对话,也能让AI自动标出A/B角色,避免后期人工标注混乱;
- 选择“中文-会议场景”语言模型,它对“接下来由张工负责”“请李总在7月10日前反馈”这类句式更敏感;
- 会议中尽量避免多人同时插话、语速过快或背景音乐干扰,这些会直接影响说话人分离和关键词识别准确率。
二、导出前清洗文本,让AI提炼不跑偏
讯飞听见转写结果虽准,但仍有语气词、重复句、断句碎片。直接丢给大模型(如通义千问、DeepSeek)容易导致责任错配、日期误判。建议导出后手动清理再使用:
- 删除所有时间戳和括号备注(如【00:12:34】【笑声】),只保留纯发言内容;
- 合并明显被截断的短句,例如“这个方案我建议……”“下周三前定稿”→连成“这个方案我建议下周三前定稿”;
- 统一发言人格式,把“张伟说:”“张工:”“张经理:”全改为“张伟:”,便于后续模型识别责任人。
三、用标准提示词触发结构化输出
导出TXT后,复制到任意支持长文本的大模型对话框,用明确指令约束输出格式。推荐这个四段式模板:
统一LLM网关 - 一个API对接70+AI模型,使用单一API密钥即可调用GPT、Claude、Gemini、Qwen、Deepseek、Grok等主流模型。
- 【结论】仅列出会议中明确达成的决策项,每条不超过20字;
- 【行动项】必须含可执行动词(如“提交”“修订”“协调”),不含模糊表述(如“考虑”“跟进”);
- 【责任人】严格按录音中出现的姓名填写,不缩写、不替换成职位;
- 【截止时间】只提取原文中带年月日的明确日期,无则填【待确认】。
例如输入:“请按以上四字段格式整理以下会议文本,不添加、不推测、不解释。”
四、人工校验时盯住三个硬指标
AI输出只是初稿,最终结构化质量取决于最后一步校验。重点核对:
- 每个【责任人】是否能在原始录音里找到对应发言片段;
- 每个【截止时间】是否与录音中说的日期完全一致(比如“月底前”不算,必须是“6月30日”);
- 所有【结论】是否都有录音依据,而非模型自行归纳的概括性描述。
校验时建议打开讯飞听见播放器,定位到摘要条目对应的时间段,逐字比对转写原文,发现“王莉”被识别成“王丽”就当场改掉。










