☞☞☞AI 智能聊天, 问答助手, AI 智能搜索, 多模态理解力帮你轻松跨越从0到1的创作门槛☜☜☜
必须按原子性、闭环性、依赖顺序三原则拆解复杂任务:先校验输入音频文件,再转写为srt,接着情绪分析输出json,然后生成结构化markdown摘要,最后同步至飞书表格,并为每步设置唯一id与可验证锚点。
当你需要让minimax agent处理“整理客户投诉录音→转文字→提取情绪关键词→生成日报摘要→同步到飞书表格”这类多环节、跨模态、带条件分支的复杂需求时,指令不能只写“帮我处理投诉录音”,必须按原子性、闭环性、依赖顺序三原则逐层拆解。
先锁定核心目标,剔除模糊表达
通读原始需求,划掉所有主观形容词和开放式动词。例如,“快速整理”中的“快速”无验收标准,“帮忙看看”不构成可执行动作,“大概总结一下”无法触发Verifier校验。只保留具备明确输入源、确定输出格式、可判定成败的动作短语。
把“生成日报摘要”改为“输出含日期、投诉编号、情绪标签(愤怒/失望/困惑)、TOP3问题关键词的Markdown表格,共7行,首行为表头”。【修改后每项输出都可被程序自动比对是否缺失字段或行数错误】
按依赖顺序拆成线性子任务链
第一步:确认输入就位 → 检查本地文件夹“/complaints/202607/”下是否存在以“CALL_”开头、扩展名为“.m4a”的音频文件,数量≥1;若无,中止并返回错误码E101。
第二步:语音转写 → 调用mmx-cli audio transcribe命令,参数--model whisper-v3 --language zh --output-format srt,输出路径固定为“/complaints/202607/transcripts/”。
第三步:情绪识别 → 读取上一步生成的全部.srt文件,用MiniMax M3内置情绪分析工具逐段打标,仅保留置信度>0.85的情绪标签,合并去重后输出JSON数组,字段为{"call_id":"CALL_20260701_001","emotion":["愤怒","困惑"]}
第四步:摘要生成 → 将第三步JSON与对应.srt文本拼接为新上下文,输入M3模型,指令限定:“严格按以下结构输出:1. 总计受理X通;2. 情绪分布饼图数据(仅数字);3. 问题关键词云(限5个,按频次降序);4. 建议措施(3条,每条≤12字)”。
第五步:飞书同步 → 调用feishu-spreadsheet API,将第四步输出的4个模块分别写入指定表格的A1:D7区域,写入前校验目标表格是否开启编辑权限,否则报错E204并暂停任务。
对非线性分支做显式条件标注
方法一:用if-then语法内嵌判断逻辑
在第四步摘要生成指令末尾追加:“if 情绪标签含‘愤怒’且出现频次≥3 → 在‘建议措施’末尾强制增加第4条:‘立即升级至客诉总监’;else → 不添加。”
方法二:预设失败兜底动作
在第五步飞书同步描述后加一句:“若API返回403错误 → 自动切换备用账号token_bak_202607,并重试一次;若仍失败 → 将摘要内容保存为PDF,路径为/complaints/202607/reports/daily_summary_20260703.pdf,不再重试。”
注意:条件分支必须绑定具体触发值(如“≥3”“403”),禁止使用“如果很多”“假如不行”等模糊表述,否则Worker无法解析执行。
给每个子任务配唯一ID与验收锚点
为第一步分配ID:T1_INPUT_CHECK,验收锚点是“返回文件列表或E101错误码”;
为第二步分配ID:T2_TRANSCRIBE,验收锚点是“/transcripts/目录下生成同名.srt文件且大小>5KB”;
为第三步分配ID:T3_EMOTION_TAG,验收锚点是“输出JSON中每个call_id对应emotion数组长度≥1”;
为第四步分配ID:T4_SUMMARY_GEN,验收锚点是“输出严格包含4个编号段落,第2段为纯数字,第3段为5个中文词”;
为第五步分配ID:T5_FEISHU_SYNC,验收锚点是“飞书表格A1单元格值等于当日日期字符串”。【缺少任一锚点,Verifier将判定该子任务失败并触发回滚】











