需借助whisper desktop将音频转文字,再用chatgpt结构化处理并校对字幕:① whisper导出带时间戳的srt/txt;② chatgpt批量生成摘要、要点、关键词;③ 校正srt断句与错字;④ vs code自动命名合并文件。
☞☞☞AI 智能聊天, 问答助手, AI 智能搜索, 多模态理解力帮你轻松跨越从0到1的创作门槛☜☜☜

你需要把几十期播客或多个视频的音频文件统一转成文字、提取重点、生成字幕,但又不想手动逐个上传、反复粘贴、重复操作——ChatGPT 本身不支持直接上传音频文件,必须借助外部工具链完成音频→文本→结构化处理的闭环。
第一步:把音频变成可读文本(绕过ChatGPT上传限制)
打开 Whisper Desktop(开源免费,离线运行,支持 MP3/WAV/M4A),拖入你的播客音频文件夹→点击“Transcribe”→选择语言(中文选“zh”)→勾选“Add timestamps”→导出为 SRT 或 TXT。这一步不能跳过,【ChatGPT无法直接读取音频文件,所有后续操作都依赖这个纯文本输入】。如果用在线版 Whisper API,注意单次上传上限通常为 25MB,大文件需先切片。
第二步:批量喂给ChatGPT做结构化处理
方法一:用 ChatGPT 的“文件上传”功能(仅限 Plus 用户)
将上一步生成的多个 TXT 文件(每期播客一个)一次性拖进对话框→输入指令:“请为每个文件生成三部分内容:① 300字以内摘要;② 按时间戳分段的要点列表(每段不超过2行);③ 提取5个关键词。输出格式严格按:【文件名】→ 摘要 → 要点 → 关键词。”
注意:一次最多传10个文件,超量需分批。
用于在用户想通过浏览器自动化与 Google Gemini 或 ChatGPT 交互时。触发短语包括“ask Gemini”“ask ChatGPT”“ask GPT”“让...”。
方法二:零门槛批量(适合普通用户)
把所有 TXT 内容复制进 Excel,B列粘贴原文,A列填对应播客标题;用公式 =CONCATENATE("【",A2,"】\n",B2) 合并成一条长文本;分段粘贴到 ChatGPT(每次≤8000字符)→指令写清楚:“你正在处理第X段,共Y段,请只输出本段结果,不要复述问题、不要加说明”。
第三步:生成标准字幕文件(SRT格式)
第一步导出的 SRT 已含时间轴,但常有断句不准、错字多的问题。把原始 SRT 内容粘贴进 ChatGPT,输入:“你是一个专业字幕校对员。请修正以下 SRT 字幕:① 合并过短的句子(时长<1.2秒的合并到前/后句);② 拆分超长句(>12字且含逗号/顿号);③ 修正同音错字(如‘权利’→‘权力’、‘形事’→‘行事’);④ 保持原有时间码不变。只输出修正后的 SRT 内容,不加任何解释。”
这一步必须人工抽检前3条和最后3条时间码是否错位,【一旦时间轴偏移,整个字幕将不同步,无法挽回】。
第四步:自动合并与命名(省去手动整理)
① 打开 VS Code,安装插件 “Paste CSV as Table”;
② 把 Excel 中整理好的标题+摘要+关键词表复制→在 VS Code 新建文件中右键 “Paste as Table”;
③ 全选表格→Ctrl+Shift+P → 输入 “Sort Lines” → 选择“Sort lines ascending”;
④ 在每行末尾插入制表符,再用正则替换:搜索 \t(.*?), 替换为 _\1.mp3 —— 这样就自动生成了“标题_关键词.mp3”的文件名清单。










